Как я написал свой мигратор для ClickHouse — и почему он до сих пор жив
В 2020-м мне понадобилось версионировать схему ClickHouse в CI/CD, а готового инструмента под Go с поддержкой ClickHouse не нашлось ни одного. Пришл…
Tech news from the best sources
В 2020-м мне понадобилось версионировать схему ClickHouse в CI/CD, а готового инструмента под Go с поддержкой ClickHouse не нашлось ни одного. Пришл…
parquet - данные лежат в открытом формате - казалось бы, бери кто хочешь. Но есть неприметный артефакт, от которого зависит, увидите вы таблицы или…
Когда вышел DuckDB 1.0, я написал статью Всё что нужно знать про DuckDB . Теперь вышел DuckLake v1.0 — LakeHouse-формат из той же экосистемы. Это от…
Why two successful queries can count different rows when they resolve different Delta or Iceberg table states. Two queries return different counts f…
TL;DR — DuckDB, DataFusion, Polars, and Postgres each compute and store table statistics their own way, so a histogram built in your ELT pipeline is…
Every time this comes up, someone credits the same setup: Athena on Iceberg is where "the code is the spec" — where you open Git and read the whole…
Original Japanese article : Iceberg REST Catalogを直接叩いて、Glue Data CatalogとS3 Tablesの違いを理解する Introduction I'm Aki, an AWS Community Builder ( @jitepen…
Quick Recap: What We Built in Part 1 In Part 1 , we built a metadata catalog on Apache Iceberg (S3 Tables) that makes unstructured files on FSx for…
What Works Now vs What Requires Validation This article separates verified AWS-native capabilities from cross-platform paths that still require vali…
Привет, Хабр! Меня зовут Дмитрий Кравчук, я занимаюсь всем, что связано с данными в блоке AI&ML MAGNIT TECH. Расскажу про фундамент прибыльных п…
Original Japanese article : データの主導権から考えるAWSとSnowflakeのレイクハウスアーキテクチャ Introduction I'm Aki, an AWS Community Builder ( @jitepengin ). When designing a…
Сегодня SCD-2-таблицы не только остаются актуальными для медленно меняющихся данных, но и, на мой взгляд, становятся гораздо проще в реализации благ…
Introduction Apache Iceberg is the table format that turns a pile of Parquet files in object storage into something that behaves like a warehouse ta…
Why this project I built this repo because I didn't have one of this kind yet and, having worked on data ingestion with Glue for a while, I wanted t…
iceberg и его философия metadata расскажем почему iceberg эффективно выполняет запросы и прост в управлении данными благодаря своей metadata Читать…
The future of Kafka is diskless topics + native Apache Iceberg / Delta Lake integration Intro Ursa is a relatively new engine that's being fitted in…