Инфраструктура данных 2052: что, если у данных больше не будет «прода» и «истории»?
Если мысленно вернуться в 1980-е , аналитика во многом находилась буквально над production Данные появлялись в операционных системах, затем из них с…
Tech news from the best sources
Если мысленно вернуться в 1980-е , аналитика во многом находилась буквально над production Данные появлялись в операционных системах, затем из них с…
A follow-up to Part 2: Databricks and FSx for ONTAP S3 Access Points in the "FSx for ONTAP S3 Access Points x Lakehouse Deep Dive" series. Some resu…
parquet - данные лежат в открытом формате - казалось бы, бери кто хочешь. Но есть неприметный артефакт, от которого зависит, увидите вы таблицы или…
Why two successful queries can count different rows when they resolve different Delta or Iceberg table states. Two queries return different counts f…
A pipeline job finishes without an error. The new table has 18% fewer rows. Should you rerun the pipeline, stop the release, or trust the new output…
*.parquet - данные лежат в открытом формате - казалось бы, бери кто хочешь. Но есть неприметный артефакт, от которого зависит, увидите вы таблицы ил…
В аналитике больших данных системы массивных параллельных вычислений часто находятся под постоянной нагрузкой в режиме 24/7. Из десятков и сотен тыс…
Когда речь заходит про Lakehouse и федеративный доступ , многие вспоминают про Trino и… часто на этом все. Но федеративные запросы поддерживаются в…
«Отдельные базы больше не нужны», «конец пайплайнов» - каждую неделю кто-то крупный со сцены хоронит то, что ты вчера поставил в прод. ClickHouse по…
📚 Series: Databricks on AWS (Part 0, prologue) The Target Architecture ← you are here Building a Databricks AI Platform on AWS RBAC with Function-Ro…
Привет, Хабр! На связи команда Data Sapience. С последней публикации результатов тестирования MPP-движков прошло уже несколько месяцев. За этот пери…
Apache Paimon: стриминговый lakehouse для дата-инженеров Сколько систем вы держите ради того, чтобы аналитики видели события через секунды, а годовы…
Enterprise data platforms are really good at one thing: creating copies of the same data everywhere. Different teams copy the same curated folders i…
Привет, Хабр! Меня зовут Дмитрий Кравчук, я занимаюсь всем, что связано с данными в блоке AI&ML MAGNIT TECH. Расскажу про фундамент прибыльных п…
Сегодня SCD-2-таблицы не только остаются актуальными для медленно меняющихся данных, но и, на мой взгляд, становятся гораздо проще в реализации благ…
Когда инженер слышит «нам нужно хранилище данных», задача редко звучит однозначно. Кто-то задыхается на боевой OLTP-базе под аналитической нагрузкой…
Привет, Хабр! На связи Илья Амосов из команды поддержки Lakehouse-платформы данных Data Ocean Nova вендора Data Sapience. В сегодняшней публикации я…
DatAasee Tech Stack Canvas Setting: Many distributed data and metadata sources Goals: Centralize metadata Interlinked metadata catalog Super-index f…