1.9 KiB
1.9 KiB
captured_at
| captured_at |
|---|
| 2026-09-14T10:19:30+02:00 |
Kombinace DuckDB + Apache Iceberg + dbt vypadá zajímavě. Vytáhni z článku a případně online zajímavé informace a ulož je, hlavně pro jaký usecase je tato kombinace užitečná. Není třeba ukládat celý článek.
Klíčové body z článku (DuckDB Just Put a $400K/Year Skill on Your Laptop, DataExpert, Medium, 2026-09-03):
- DuckDB v1.5.3 (květen 2026): plná podpora zápisu do Iceberg tabulek (MERGE INTO, ALTER TABLE, partition transforms, Iceberg V3). Dřív jen čtení — teď i správa tabulek lokálně, bez Spark clusteru.
- Apache Iceberg: enterprise standard, Apache Polaris (volný self-hostable REST catalog) graduoval na top-level Apache projekt (únor 2026).
- dbt Core: Apache 2.0, bez seat limitů, baseline skill v data engineeringu; dbt-duckdb adapter — SQL/modely identické lokálně i na produktion (Snowflake/BigQuery), jen se mění target.
- DuckLake (duben 2026, v1.0): lakehouse formát s metadaty v SQL databázi (SQLite/Postgres/DuckDB) místo metadata souborů v object storage. Řeší catalog problem i small-file problem (data inlining).
- Use case: celý enterprise lakehouse skill stack (incremental loading, SCD Type 2, partition pruning, schema evolution, data quality, compaction) se dá naučit a prototypovat na laptopu za $0, místo placeného Snowflake/Databricks compute.
- Benchmarky z článku: FinQore 8h pipeline → 8 min na DuckDB (60x); dashboard dotazy 200–400ms vs 2–5s Snowflake X-Small; MotherDuck: 6–7x rychlejší než ekvivalentně ceněné Snowflake/Redshift pro 10–100GB data.
- Omezení: DuckDB 1 writer (concurrency), Iceberg+Parquet 2–3x pomalejší než nativní DuckDB formát, small-file/manifest explosion se na laptopu neprojeví (data moc malá) — production problémy se naučí až na produkci.
- AWS acquirenul DuckLabs (tým za DuckDB) v srpnu 2026; projekt zůstává MIT pod DuckDB Foundation.