Откуда взялся ИИ и причем тут слово перцептрон
Путь от первой попытки смоделировать нейрон до систем, которые сегодня пишут код и ведут диалог, занял меньше 70 лет — и почти обвалился на середине…
Tech news from the best sources
Путь от первой попытки смоделировать нейрон до систем, которые сегодня пишут код и ведут диалог, занял меньше 70 лет — и почти обвалился на середине…
Что видит трансформер: крокодила, лодку или силуэт человека? Проверяем BLIP на визуальных иллюзиях. Наверняка многие видели картинки-тесты, которые…
Большинство нейросетей работают с числами и читать как человек они не умеют, поэтому инженерами были придуманы способы помочь нейросети уловить не т…
Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с с…
Начнем с простого. Вы скачали нейросеть, и теперь у вас на диске лежит файл на несколько гигабайт, внутри которого миллиарды чисел. Этот файл можно…
Привет! Я Олег Лашинин, руковожу направлением рекомендательных систем в Т-Банке. Когда в экосистеме десятки сервисов — от покупки продуктов в суперм…
В декабре 2023 по ML-тусовке прокатилась волна заголовков в духе «трансформерам конец». Поводом стала статья двух исследователей — Альберта Гу и Три…
Привет, Хабр! Меня зовут Татьяна Земскова, я аспирантка МФТИ и научный сотрудник команды Embodied Agents лаборатории Cognitive AI Systems AIRI. Обла…
В 2017 году в мире нейросетей произошел почти незаметный переворот. Без громких презентаций и человекоподобных роботов исследователи из Google опубл…
Можно ли взять алгоритм из маленькой нейросети и «вставить» его в большую языковую модель на лету, без дообучения? Мы проверили эту гипотезу на моду…
Наверняка все, у кого есть дети, слышали вопрос «чем ты занимаешься на работе?» Мне его точно задавали, и неоднократно. Дать ответ на …
Наверняка все, у кого есть дети, слышали вопрос «чем ты занимаешься на работе?» Мне его точно задавали, и неоднократно. Дать ответ на …
Многие свежие SOTA-статьи по детекции аномалий во временных рядах заявляют F1 ≈ 99%. Мы проверили один из таких методов, и оказалось, что волшебство…
За attention-механизм с 2017 года брались сотни раз: sparse attention, linear attention, MoE, MLA, скользящие окна, что только не. А вот residual co…
В ML‑проектах проблемы часто начинаются не с выбора алгоритма, а с предобработки: один трансформер забыли применить к …
Это продолжение цикла статей о масштабировании тренировки и инференса LLM. Предыдущая статья А теперь перейдем к чему-то более практическому, а имен…
Базовая теорема машинного обучения гласит, что нейросеть с одним скрытым слоем может выучить любую функцию в мире, если сделать этот слой достаточно…
Главный страх любого инженера ошибка CUDA Out of Memory . Мы выстраиваемся в очереди за H200 на 140 ГБ. Но как только мы спускаемся с уровня P…
Все знают, что трансформеры можно масштабировать: просто добавь больше слоев, и модель станет умнее. Но на практике попытка обучить трансформер глуб…
В классическом программировании ошибка в коде приводит к крашу. В Deep Learning ошибка в коде часто приводит к тому, что модель просто находит спосо…
Долгие годы в NLP считалось правилом хорошего тона связывать матрицу входных эмбеддингов с матрицей выходного классификатора (Weight Tying), чтобы с…
Геометрия Attention: почему QK Norm это не просто костыль для стабильности, а способ заставить сеть понимать смысл Читать далее
Всем привет! С вами Артемий Лямин ( @lyaminartemiy ) и Иван Тренёв ( @123-39 ). Мы работаем специалистами по разработке нейронных сетей в команде ав…