Проверка теории улучшения результата LoRA файн‑тюнинга на «умных» слоях
При LoRA‑дообучении адаптеры обычно применяются ко всем слоям модели, хотя активность разных слоев во время обработки промпта заметно разл…
Tech news from the best sources
При LoRA‑дообучении адаптеры обычно применяются ко всем слоям модели, хотя активность разных слоев во время обработки промпта заметно разл…
Как вы себе представляете работу OCR? Страничка сканируется, программа находит области с буквами, распознает их и выдает текст. Старый добрый Tesser…
LangChain 0.3.0 LangChain 0.3.0 is a popular AI framework that enables developers to build applications with large language models through enhanced…
Last week, a Baseten inference engineer who goes by @waterloo_intern published a technical blog post titled "22,580: From GPT-2 to Kimi K3, Explaine…
Привет, Хабр! Меня зовут Владимир, и это пятая часть цикла статей по написанию и обучению небольшой decoder-only LLM с нуля. В прошлых частях мы соб…
Привет, Хабр! Меня зовут Владимир, и это четвёртая часть цикла статей по написанию и обучению небольшой decoder-only LLM с нуля. Данная статья целик…
Древняя модель ruGPT-3 XL 1.3B конца 2020 - начала 2021. Модели тех времён не умели выполнять инструкции или вести диалог в чате, они умели только п…
An interactive guide to the architecture behind modern language models. Instead of predicting the next word, this Transformer predicts the next move…
ИИ-агент может вернуть правильную строку и при этом пройти к ней самым дорогим маршрутом: читать лишний код, угадывать API, падать на ошибках и зано…
Привет, Хабр! Меня зовут Владимир, и я давно хотел погрузиться во вселенную Warhammer40K. Для погружение во вселенную я решил обучить LLM на лоре Wa…
Это статья-продолжение про фреймворк Meta-Spider, который был описан здесь . В этом выпуске мы рассмотрим, насколько мета-внимание бьет (и бьет ли в…
Привет, Хабр! Меня зовут Татьяна Земскова, я аспирантка МФТИ и научный сотрудник команды Embodied Agents лаборатории Cognitive AI Systems AIRI. Обла…
Трансформеры уже умеют писать код, генерировать тексты и рисовать картины. Но могут ли они управлять автономным автомобилем в реальны…
The original Transformer idea is still alive. But modern LLM blocks are not just the 2017 Transformer copied and scaled. They are engineered for dee…
LLMs generate text one token at a time. That sounds simple. But without KV Cache, every new token would repeat a lot of old work. That is why infere…
Your model got smarter. But suddenly it got slower. Why does increasing context length explode compute? Because attention is O(n²). And that becomes…
Это прямое продолжение статьи "meta-attention is all you need" . Будет представлен фреймворк с заготовленным набором инструментов, который вы сможет…
Self-Attention is not just “looking at important words.” It is a matrix operation. And that is exactly why Transformers scale. Core Idea Self-Attent…
Всем привет! Мы команда прикладных исследований и разработки моделей глубокого обучения Альфа-банка. В этой статье мы хотели бы рассказать о на…
В этой статье я расскажу о интересной находке во время моих экспериментов с языковыми моделями, которую я решил назвать "мета-трансформерами". Или я…
[Day 7] Does Giving an AI More "Thinking Time" Really Make It Smarter? Training an OpenMythos-Style Mini Model on DGX Intro Day 7! Reddit kept surfa…
Поговорим о том, как превращать последовательности пользовательских событий в векторы, зачем обучать BERT на "языке" клиентского поведения и почему…
У больших языковых моделей есть неприятное свойство: снаружи ответ может выглядеть одинаково уверенно и тогда, когда модель действительно «собрала»…