RU

«Тосок бессмысл»: как я не смог заставить Gemma 4 писать хорошие стихи

Дано: стихотворение. Тема — «тщетность накопления жизненного опыта», амфибрахий, четыре строки. Заканчивается словом «тосок». Такого слова в русском…

LLMLoRAфайнтюнингGemmaгенерация стиховсиллабо-тоникарифмаограниченное декодированиеreward hackingvLLM
Habr
RU

«Четыре шага — и точка» Я сам придумал главное ограничение своего приложения

Пару недель назад я рассказывал здесь, как три ночи чинил рендер, который не был сломан . С тех пор в главном ничего не изменилось: я по-прежнему эн…

FLUX.2KleinMLXApple Siliconгенерация изображенийLoRAобучение LoRASwiftmacOSлокальный ИИ
Habr
RU

[Перевод] Нехватка CUDA-памяти при обучении с GRPO: как перестать гадать и начать считать

Ошибка CUDA out of memory при обучении LLM обычно превращается в бесконечный цикл случайных правок: уменьшили batch size, урезали sequence length, с…

NLPLLMGRPOобучение с подкреплениемCUDA out of memoryvLLMоптимизация GPU памятидообучение моделейLoRAPyTorch
Habr
RU

Хотел упростить мониторинг проектов и в отпуск — пришлось обучать свой LLM.Часть 3.Дистилляция

Третья часть про DevOps-агента Oni. В первой статье я встретился с реальностью — локальные модели не справляются с простыми задачами. Во второй разб…

LLMфайнтюнингfine-tuningLoRADevOps-агентOllamaобучение LLMcatastrophic forgettingUnslothAI-агент
Habr
RU

Хотел упростить мониторинг проектов и в отпуск — пришлось обучать свой LLM.Часть 2.Обучение

Продолжаем серию про файнтюнинг и создание DevOps-агента Oni. В прошлой части я встретился с реальностью — ни одна локальная модель не справилась с…

LLMфайнтюнингfine-tuningQwen3LoRADevOps-агентобучение LLMcatastrophic forgettingUnslothAI-агент
Habr