RU

DML против PSM: как оценивать нерандомизированные эксперименты быстрее и надёжнее?

Привет, Хабр! Давайте на примере кейса с рекламой в ПВЗ Wildberries разберемся в двойном машинном обучении (DML) и методе псевдорандомизации (PSM).…

causal inferencedouble machine learningpropensity score matchingab-тестированиеmachine learningрекламамаркетинганалитика данныхпродуктовая аналитикаdata science
Habr
RU

Positional encoding или как нейросеть «читает» текст

Большинство нейросетей работают с числами и читать как человек они не умеют, поэтому инженерами были придуманы способы помочь нейросети уловить не т…

нейросетипрограммированиеэмбеддингиэмбеддингпозиционный контекстdata scienceembeddingtransformerтрансформерынейросеть
Habr
RU

Какие профессии создал ИИ: разбор с цифрами

Всем привет! Я Ольга Матушевич, преподаватель курса «Нейросети для бизнеса» , а в прошлом наставница на курсе «Аналитик данных» . Про то, что нейрос…

нейросетиискусственный интеллектaiпрофессии будущегопрофессии в itai профессиианализ данныхdata scienceаналитик данных
Habr
RU

Почему цена Bitcoin «сломалась»: разбор аномалий 2022–2026 с WhyTrend

Увидел провал на графике → открыл Google или Twitter → полдня собираешь версии "почему". Знакомо? Детектор аномалий сам по себе даёт только точки на…

pythonopen-sourcetimeseriesанализ данныхanomaly detectionllmпрограммированиеdata miningпоиск информацииdata science
Habr
RU

Платформа — не самоцель: когда ML-разработку стоит унифицировать, а когда лучше остановиться, обсудили на «ИТ-Пикнике»

Машинное обучение часто воспринимают как работу над моделью: есть данные, алгоритм, обучение и результат. В крупных компаниях основная сложность пос…

mlмтсрекомендательные системыml-платформаdata sciencerectoolscoolgraphскорингплатформизация
Habr
RU

Ищем Грааль на рынке криптовалют

🏆 Ищем Грааль на рынке криптовалют Искал Грааль в крипте через TradingView Ideas: прошлые результаты авторов не предсказывают будущее, зато работает…

typescriptjavascriptpythonисскуственный интеллектмашинное+обучениеdata scienceаналитика данныхмосбиржаbinanceкриптовалюты
Habr
RU

Чемпионат среди uplift-моделей: групповой этап, плей-офф и неожиданный лидер

Привет! Меня зовут Гриша Крюков , я аналитик в команде доверия и безопасности Авито . Я провёл чемпионат среди четырёх популярных моделей для оценки…

avitoavitotechаналитикаuplift modellingcausal inferenceмашинное обучениеcausalmldata analysisdata science
Habr
RU

Все, что нужно знать про построение точечных оценок

Что происходит под капотом, когда вы вызываете scipy.stats.norm.fit() ? В статье рассматриваются два классических подхода точечного оценивания парам…

точечные оценкиметод моментовметод максимального правдоподобияматематическая статистикаMLEpythonscipydata science
Habr
RU

От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»

Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сет…

data engineerbigdatamlopsdata scienceosapysparkоблачные вычисленияархитектура системыdatalake
Habr
RU

Разбираемся в ML без воды: от базы до Attention. Часть 13: Кластеризация и k-means

В предыдущей главе мы рассматривали ситуацию, когда данных слишком много: большое количество признаков затрудняет их анализ, увеличивает вычислитель…

кластеризацияk-meansk-means++data scienceмашинное обучение
Habr
RU

Шаг вперёд на долгом пути: завершили этап «Сканирование» конкурса «Экспедиция. Data Science»

Фонд Национальной технологической инициативы реализует проект технологических конкурсов Up Great — открытых соревнований для инженерных команд. Здес…

конкурс разработчиковархеологиянейросетьсканированиеПО для археологовdata science
Habr
RU

Топ вопросов по LLM: стратегии генерации текста и метрики оценки LLM

На NLP/LLM-собеседованиях часто проверяют не то, знаешь ли ты слова top-k, top-p и BLEU, а понимаешь ли ты, что происходит с распределением вероятно…

машинное обучениеискусственный интеллектnaturallanguageprocessingdeeplearninglarge language modeldata science
Habr
RU

Разбираемся в ML без воды: от базы до Attention. Часть 12: Понижение размерности и PCA

В предыдущей части мы разобрали градиентный бустинг — финального босса в классическом обучении с учителем. Мы научились строить мощные ансамбли, кот…

понижение размерностиPCAпроклятие размерностимашинное обучениеdata sciencesvd
Habr
RU

Как я собрал эталонный Data Engineering проект: ClickHouse, Kafka, Spark, dbt, Airflow и Superset за одну команду

Меня зовут Андрей, я работаю с данными. И так получается, что на реальных проектах у меня никогда не было возможности собрать идеальный, на мой взгл…

data engineeringdata sciencedata miningbig datacryptocurrency
Habr
RU

Разбираемся в ML без воды: от базы до Attention. Часть 11: Градиентный бустинг

В десятой части при изучении случайного леса мы наткнулись на проблему: переход от одиночного дерева к лесу частично снизил дисперсию, но вопрос со…

градиентный бустингxgboostlightgbmcatboostмашинное обучениеdata science
Habr
RU

Ключевые основы автоматического выбора алгоритмов кластеризации мультимодальных данных на основе мета-обучения

Задача кластеризации относится к классу «обучения без учителя» и является фундаментальным инструментом exploratory data analysis (разведочный анализ…

Автоматическая кластеризациямета-обучениемультимодальные данныеAutoMLвыбор алгоритмовdata sciencemeta-learningAutoClusteringобучение без учителяllm
Habr
RU

Разбираемся в ML без воды: от базы до Attention. Часть 10: Бэггинг и случайный лес

В предыдущей части мы изучали дерево решений и, несмотря на его замечательные свойства, наткнулись на один огромный недостаток — нестабильность. Каз…

baggingrandom forestout-of-bagoobbootstrappingaggregatingдерево решениймашинное обучениеdata science
Habr
RU

Чуть не отчислили за программирование, а сейчас Senior Data Scientist

Спойлер: я не выпускник МФТИ, не олимпиадник и ненавидел программирование. У меня было 45 баллов ЕГЭ по математике, диплом инженера ПГУПС и стойкое…

путь в ITмашинное обучениесмена профессиивойти в ITкак стать data scientistdata science
Habr
RU

Пока все смотрят на LLM: почему классический ML годами зарабатывает сотни миллионов?

Пока лента обсуждает LLM и агентов, а инвесторы спорят про окупаемость GenAI, «скучный» классический ML тихо зарабатывает реальные деньги. Я Senior…

data scienceмашинное обучениеmachine learningdata analystjuniorкарьера в itкак стать data scientistклассический MLсобеседованиесобеседование data scientist
Habr
RU

Разбираемся в ML без воды: от базы до Attention. Часть 7: SVM и SGD

В шестой части мы разобрали логистическую регрессию и увидели, как линейная модель может разделять классы с помощью вероятностного подхода. В этой ч…

svmклассификацияkernel tricksgdстохастический градиентный спускhinge lossdata scienceml
Habr
RU

Inside AI Meetup — как это было? Делимся записями докладов, фото и атмосферой

Привет! 20 мая прошел  Inside AI Meetup от Wildberries & Russ — про практические кейсы внедрения ИИ: векторный поиск и модерация с 200+ мод…

aiииискуственный интеллектmlmachine learningмашинное обучениемитапdsdata sciencemeetup
Habr
RU

Новинка: Прикладные API для искусственного интеллекта и Data Science

В течение последних двух лет мы проделали большую работу по изданию неустаревающих книг, связанных с проектированием и развитием API. Как известно,…

apiкнигиdata scienceискусственный интеллектlangchainstreamlitpython
Habr
RU

Изучаем машинное обучение scikit-learn за одну статью: от понимания API до боевого пайплайна

Осваиваем scikit-learn за 20 минут 🚀 Выкатил на Хабр гайд для тех, кто хочет понять классический ML на Python без воды. Внутри: — Главный секрет биб…

pythonscikit-learnmachine learningмашинное обучениеdata scienceруководстводля начинающих