RU

Учим небольшую LLM с нуля: гибридное внимание, XSA, доменные бленды и загадки роста онлайн-бенчмарков

Обучение LLM — это в первую очередь инфраструктурная задача: нужен пайплайн, который можно перезапускать с новыми данными, архитектурой или другим р…

llm-моделиsftrwb
Habr
RU

Memorization vs Generalization: что действительно умеет языковая модель (TLM) на 2 160 параметров (v1.1.0)

Продолжая тему Крошечной Языковой Модели на Nodejs мы поймем где проходит граница ее возможностей. На примере Крошечной Языковой Модели (TLM) из 2 1…

machinelearningmachine learningbackpropagationself-attentionautogradnodejsjavascriptsftнейронная сетьtransformer
Habr
RU

[Перевод] Языковая Модель без магии: Крошечная Language Model на чистом Node.js

Мы создаем крошечную языковую модель с нуля на чистом Node.js без использования TensorFlow или PyTorch, реализуя нейроны, автоград, эмбеддинги, меха…

machinelearningmachine learningbackpropagationself-attentionautogradnodejsjavascriptsftнейронная сетьtransformer
Habr
RU

Дообучим старый ruGPT3 XL 1.3B (~2020 год) до уровня LLM. ChatGPT выйдет только через 2 года. Сравним с Gemma3 2025 года

Древняя модель ruGPT-3 XL 1.3B конца 2020 - начала 2021. Модели тех времён не умели выполнять инструкции или вести диалог в чате, они умели только п…

llama.cpptransformersобучениеfinetunerugptrugpt3sftdpo
Habr
RU

habrGPT. Обучим LLM 0.5B с нуля на статьях Хабра с помощью nanochat от Карпатого. Обучение fp8 дома и сравнение с bf16

Раскрученный проект nanochat обещает "за $100 обучите свой ChatGPT". В оригинале обучение на 8xH100 80Gb, но никто не мешает обучить его на домашнем…

nanochatsftdpoобучениеllmllm с нуляsaiga
Habr
RU

Прогнал семь LLM через свой русский спортивный бенчмарк. Базовой моделью всё равно оставляю Gemma 4 31B

Прогнали семь LLM через свой русский спортивный бенчмарк. Топовые модели closed-source выигрывают 1.5-1.7 балла. Базовой моделью всё равно остаётся…

llmбенчмаркgemmaqwenopenrouterрусский языкdorasftспортllm-judge