RU

Как превратить LLM-разметку в универсальный Spark-пайплайн

TL;DR: мы сделали llm_markup — Spark-приложение для массовой обработки данных через LLM API в существующем Airflow-контуре. Источник данных, промпт,…

data engineeringllmsparkpysparkopenai-compatible apillm-разметкаобработка текстовраспределённая обработка данныхdata pipelines
Habr
RU

От ANN к честному KNN на GPU: как мы пересобрали отбор кандидатов в рекомендациях Ozon

Привет! Мы команда рекомендательной системы Ozon, и сегодня мы хотим рассказать о нашем пути от приближённого поиска соседей (ANN) к точному KNN на…

annrecsysbigdataretrievalknnsparkpytorchgpuрекомендательные системыozon tech
Habr
RU

CI/CD для данных и моделей на Airflow: как мы деплоим прогноз спроса в «Магните»

Артефакт нашей сборки — не бинарник, а код вместе с терабайтами рассчитанных таблиц. Рассказываем, как из штатных фич Airflow, Spark и Delta Lake у…

mlopssparkairflowdelta lakes3data engineeringмашинное обучениепрогнозирование спросаDataOpsоркестрация пайплайнов
Habr
RU

Последовательное иерархическое распределение сумм между получателями. Постановка задачи. Выбор технологий

На текущем месте работы я иногда вижу запросы на систему распределения затрат по определенным правилам, которые должны гибко изменяться без необходи…

sparkgraphapache spark
Habr
RU

Когда автоматизация становится умнее: как трансформеры изменили AutoDL в Альфа-Банке

Всем привет! С вами Артемий Лямин ( @lyaminartemiy ) и Иван Тренёв ( @123-39 ). Мы работаем специалистами по разработке нейронных сетей в команде ав…

глубокое обучениеавтоматизациямашинное обучениетрансформерыpythondartsfusionsparkmlmlops