diff --git a/notes/done/2026-09-14_10_19_30_263437-kombinace-duckdb-apache.md b/notes/done/2026-09-14_10_19_30_263437-kombinace-duckdb-apache.md new file mode 100644 index 0000000..73236f6 --- /dev/null +++ b/notes/done/2026-09-14_10_19_30_263437-kombinace-duckdb-apache.md @@ -0,0 +1,15 @@ +--- +captured_at: 2026-09-14T10:19:30+02:00 +--- + +Kombinace DuckDB + Apache Iceberg + dbt vypadá zajímavě. Vytáhni z článku a případně online zajímavé informace a ulož je, hlavně pro jaký usecase je tato kombinace užitečná. Není třeba ukládat celý článek. + +Klíčové body z článku (DuckDB Just Put a $400K/Year Skill on Your Laptop, DataExpert, Medium, 2026-09-03): +- DuckDB v1.5.3 (květen 2026): plná podpora zápisu do Iceberg tabulek (MERGE INTO, ALTER TABLE, partition transforms, Iceberg V3). Dřív jen čtení — teď i správa tabulek lokálně, bez Spark clusteru. +- Apache Iceberg: enterprise standard, Apache Polaris (volný self-hostable REST catalog) graduoval na top-level Apache projekt (únor 2026). +- dbt Core: Apache 2.0, bez seat limitů, baseline skill v data engineeringu; dbt-duckdb adapter — SQL/modely identické lokálně i na produktion (Snowflake/BigQuery), jen se mění target. +- DuckLake (duben 2026, v1.0): lakehouse formát s metadaty v SQL databázi (SQLite/Postgres/DuckDB) místo metadata souborů v object storage. Řeší catalog problem i small-file problem (data inlining). +- Use case: celý enterprise lakehouse skill stack (incremental loading, SCD Type 2, partition pruning, schema evolution, data quality, compaction) se dá naučit a prototypovat na laptopu za $0, místo placeného Snowflake/Databricks compute. +- Benchmarky z článku: FinQore 8h pipeline → 8 min na DuckDB (60x); dashboard dotazy 200–400ms vs 2–5s Snowflake X-Small; MotherDuck: 6–7x rychlejší než ekvivalentně ceněné Snowflake/Redshift pro 10–100GB data. +- Omezení: DuckDB 1 writer (concurrency), Iceberg+Parquet 2–3x pomalejší než nativní DuckDB formát, small-file/manifest explosion se na laptopu neprojeví (data moc malá) — production problémy se naučí až na produkci. +- AWS acquirenul DuckLabs (tým za DuckDB) v srpnu 2026; projekt zůstává MIT pod DuckDB Foundation. diff --git a/notes/notes.md b/notes/notes.md index 5f068b8..aa374a0 100644 --- a/notes/notes.md +++ b/notes/notes.md @@ -113,3 +113,16 @@ - PySDR — https://pysdr.org Bezplatná online učebnice SDR a DSP v Pythonu od Dr. Marca Lichtmana (pysdr@vt.edu). FFT, filtry, IQ sampling, digitální modulace, synchronizace, multipath fading; kapitoly pro PlutoSDR a další SDR v Pythonu. Open source: GitHub 777arc/PySDR. Od srpna 2026 obsahuje ukázkové GNU Radio flowgraphy spustitelné přímo přes GNU Radio World (desítky ukázkových signálů). - Kontext: SDR zajímá — doma je HackRF One a RTL-SDR (+ další). + +## Data Engineering / Lakehouse + +- DuckDB + Apache Iceberg + dbt — lokální lakehouse stack zdarma. Hlavní use case: celý enterprise lakehouse workflow (incremental loading, SCD Type 2, partition pruning, schema evolution, data quality testy, compaction) se dá prototypovat a učit na laptopu za $0, místo placeného Snowflake/Databricks compute. dbt-duckdb adapter = stejné SQL/modely lokálně i na produkci (Snowflake/BigQuery), mění se jen dbt target. +- DuckDB v1.5.3 (2026-05-29): plná podpora zápisu do Iceberg tabulek — MERGE INTO (merge-on-read + positional deletes), ALTER TABLE (schema evolution, metadata-only), partition transforms `bucket`/`truncate`, Iceberg V3 (deletion vectors jako Puffin soubory, VARIANT, TIMESTAMP_NS). Dřív uměl Iceberg jen číst; zápis dřív vyžadoval Spark cluster. Ověřeno: + - https://duckdb.org/2026/05/29/new-iceberg-features + - https://duckdb.org/2025/11/28/iceberg-writes-in-duckdb +- DuckLake v1.0 (2026-04-13): lakehouse formát s metadaty v SQL databázi (catalog = SQLite/Postgres/DuckDB) místo metadata souborů v object storage. Data inlining (malé inserty/delete/updates do catalogu, default threshold 10 řádků) řeší small-file problem. Volitelná Iceberg kompatibilita. Ověřeno: + - https://ducklake.select/2026/04/13/ducklake-10/ +- Apache Polaris: free self-hostable Iceberg REST catalog, top-level Apache projekt (únor 2026) — řeší, čím nahradit Hive Metastore/Glue v lokálním setupu. +- AWS acquirenul DuckLabs (tým za DuckDB, srpen 2026); projekt zůstává MIT pod nezávislou DuckDB Foundation. +- Benchmarky (Medium článek, neověřeno primárně — brát s rezervou): FinQore pipeline 8 h → 8 min (60×, z Postgres na DuckDB); dashboard dotazy 200–400 ms vs 2–5 s na Snowflake X-Small; MotherDuck srovnání 6–7× rychlejší než ekvivalentně ceněné Snowflake/Redshift na 10–100 GB datech. +- Omezení stacku: DuckDB 1 writer (multi-process writes selhávají), Iceberg+Parquet 2–3× pomalejší než nativní DuckDB formát, small-file/manifest explosion se na laptopu neprojeví (data moc malá) — produkční operační zkušenost se naučí až na produkci.