RU

[Перевод] Автономность ИИ‑агентов в аналитике: сопротивляющаяся среда

В предыдущей статье я писал, что уровень автономности ИИ-агента слабо связан с тем, насколько умной кажется модель. Способность системы обнаруживать…

ии-агентыai agentsdata engineeringdata qualityаналитика данныхавтономность ИИтестирование ИИcoverage map
Habr
RU

Как превратить LLM-разметку в универсальный Spark-пайплайн

TL;DR: мы сделали llm_markup — Spark-приложение для массовой обработки данных через LLM API в существующем Airflow-контуре. Источник данных, промпт,…

data engineeringllmsparkpysparkopenai-compatible apillm-разметкаобработка текстовраспределённая обработка данныхdata pipelines
Habr
RU

Почему ML-модель получает неправильные признаки: Event Time, Watermarks и Apache Flink

Представьте: вы разрабатываете антифрод-систему для банка. Пользователь совершает пять покупок подряд за пару минут. Все транзакции успешно попадают…

mlmlopsjavaпродакшенapache flinkdata engineeringWatermarkstreamingreal-time MLai
Habr
RU

Книга: «Современная бизнес-аналитика. Увеличьте ценность данных с помощью Python и R»

Привет, Хаброжители! Извлечение ценности из данных — сложный процесс. Чтобы превратить данные в информацию, бизнес-аналитик должен уметь работать с…

pythonстатистика в itdata miningdata engineeringвизуализация данныхбазы данныхбизнес-моделиисследования и прогнозы в it
Habr
RU

Lightdash — BI, который живёт внутри вашего dbt‑проекта

Я — аналитик данных в команде BIGDATAHOUSE, и на всех проектах трансформацию данных реализую через dbt — де‑факто стандарт, в&nb…

business intelligenceвизуализация данныхdbtlightdashаналитика данныхbiдашбордыdata analysisdata engineering
Habr
RU

Внутри ИИ‑Напарника: как работает оркестр агентов в ритейле

Всем привет! Это Алексей из GlowByte. В прошлой статье я говорил о том, почему категорийный менеджер в большой сети часто чувств…

искусственный интеллектglowbyteмультиагентные системыdata engineeringllmprompt injectionинформационная безопасностьритейлавтоматизация бизнесаархитектура платформы
Habr
RU

Apache Iceberg: Индиана Джонс и Каталог судьбы

*.parquet - данные лежат в открытом формате - казалось бы, бери кто хочешь. Но есть неприметный артефакт, от которого зависит, увидите вы таблицы ил…

Apache Icebergкаталог данныхPolarislakehousedata engineeringPostgreSQLClickHouseTrinoDuckLakeобъектное хранилище.
Habr
RU

Apache Spark и компиляция пользовательских функций UDF на Java в рантайме

Привет, Хабр! Меня зовут Михаил Сичалов, я   руководитель проектов и эксперт практики Applied Intelligence в компании Axenix. Это вводная стать…

apache sparkjavajaninouser defined functioncompilersruntime compilationdata engineeringблог компании Axenix
Habr
RU

CI/CD для данных и моделей на Airflow: как мы деплоим прогноз спроса в «Магните»

Артефакт нашей сборки — не бинарник, а код вместе с терабайтами рассчитанных таблиц. Рассказываем, как из штатных фич Airflow, Spark и Delta Lake у…

mlopssparkairflowdelta lakes3data engineeringмашинное обучениепрогнозирование спросаDataOpsоркестрация пайплайнов
Habr
RU

AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети

Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 1…

AI-assisted developmentChatGPTавтоматизация бизнес-процессовCloudflare WorkersCloudflare D1serverlessETLинтеграция APIdata engineeringавтоматизация отзывов
Habr
RU

Пока все хоронили пайплайны, ClickHouse достраивал слои

«Отдельные базы больше не нужны», «конец пайплайнов» - каждую неделю кто-то крупный со сцены хоронит то, что ты вчера поставил в прод. ClickHouse по…

clickhousepostgresqlClickstackolaplakehousedata engineeringobservabilityколоночная субдClickHouse AgentsOpen House 2026
Habr
RU

Как я собрал базу визовых требований, где каждая ячейка ссылается на официальный источник

Привет, сообщество. Где-то два месяца назад мне пришла в голову идея, очень простая по своей сути, но ой как обширная, если начать в ней копаться бо…

визывизовое законодательствозагранпаспортрелокацияэмиграцияоткрытые данныекраудсорсингпутешествияdata engineering
Habr
RU

Data Mesh: что это и почему концепция не подходит большинству компаний в России

Как устроен Data Mesh, какие требования подход предъявляет к бизнесу и почему большинству российских компаний сегодня зачастую важнее построить зрел…

data meshbigdatadata engineeringанализ данныхбизнес-аналитика
Habr
RU

Как я собрал эталонный Data Engineering проект: ClickHouse, Kafka, Spark, dbt, Airflow и Superset за одну команду

Меня зовут Андрей, я работаю с данными. И так получается, что на реальных проектах у меня никогда не было возможности собрать идеальный, на мой взгл…

data engineeringdata sciencedata miningbig datacryptocurrency
Habr
RU

AI-метрдотель для ресторанной сети: архитектура, сценарии и интеграции

Чат-боты в ресторанном бизнесе чаще всего начинают с простой задачи: снять часть нагрузки с менеджеров и отвечать гостям на типовые вопросы. На прак…

ai-ассистентыragtelegram apicrm-системыпроектирование apipostgresqlqdrantdata engineeringавтоматизация бизнесачат-боты
Habr
RU

rapeed: in-memory OLAP-движок с собственной алгеброй связей

Меня зовут Андрей Рыжик, я Product Owner BI-направления в компании «Белый код». Эта статья – обзор платформы rapeed: in-memory OLAP-движка с собстве…

biolapin-memoryаналитика данныхdata engineeringвысоконагруженные системыархитектура поdistributed systemsmpprapeed
Habr
RU

Единая база данных гостей для ресторанной сети: интеграция Telegram, Remarked, IIKO, RocketData и платёжных систем

В ресторанных сетях данные о гостях часто распределены между несколькими системами. Бронирования хранятся в одном сервисе, чеки — в ресторанной учёт…

data engineeringcustomer data platformiikoбазы данныхtelegram apiклиентская аналитикаискусственный интеллект
Habr
RU

Медленные запросы в Impala: как анализировать profile и не выносить SQL наружу

Когда Impala-запрос начинает выполняться заметно дольше обычного, первое место, куда обычно идут смотреть, — query profile. Там есть план выполнения…

impalaapache impalaclouderacloudera managerhadoopsqlquery optimizationdata engineeringobservabilitybigdata
Habr
RU

Вам продают ИИ. Покупать нужно не его

Звонил мне на днях один знакомый CIO. Питерский, ритейл, средний бизнес, ничего особенного. Слушай, говорит, надо нам с ИИ что-то делать: все вокруг…

llmragискусственный интеллектлокальные моделиэмбеддингиархитектура данныххранилища данныхвнедрение ииdata engineeringцена ошибки
Habr
RU

DWH в 2026: четыре зоны вместо Inmon, Kimball и Data Vault 2.0

Когда инженер слышит «нам нужно хранилище данных», задача редко звучит однозначно. Кто-то задыхается на боевой OLTP-базе под аналитической нагрузкой…

dwhdata warehouseclickhouseapache icebergtrinolakehousedata engineeringархитектура данныхdata vaultdba
Habr
RU

S3 Архипелаг: разворачиваем объектное хранилище за 15 минут

На связи Илья Шуйков, руководитель продукта «Фабрика данных» компании Диасофт. В прошлой статье мы рассказали, зачем понадобилось строить свое объек…

объектное хранилищехранилищеs3объектное хранилище s3хранение данныхdata engineeringфабрика данныхDigital Q.DataFactoryS3 Архипелаг