RU

Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег

Для тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не&nb…

vLLMLiteLLMprefix cachingKV-cacheлокальные LLMинференс LLMQwenагентская разработкаRTX PRO 6000claude
Habr
RU

«Тосок бессмысл»: как я не смог заставить Gemma 4 писать хорошие стихи

Дано: стихотворение. Тема — «тщетность накопления жизненного опыта», амфибрахий, четыре строки. Заканчивается словом «тосок». Такого слова в русском…

LLMLoRAфайнтюнингGemmaгенерация стиховсиллабо-тоникарифмаограниченное декодированиеreward hackingvLLM
Habr
RU

Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле

Разговор повторяется раз в месяц: платим за API прилично, может, купим свою карту? Сел и разложил все в цифры. Час своей 5090 в рублях, пропускная с…

RTX 5090локальный инференсстоимость токенаvLLMKV-кэшокупаемость GPULLM на своём железеDeepSeekYandexGPTTCO
Habr
RU

DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57

TL;DR Железо:  2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G /…

DGX SparkvLLMLLM инференсбенчмаркспекулятивное декодированиеGB10MoEлокальные нейросетиspeculative decodingDeepSeek 0731
Habr
RU

Гибридные трансформеры под нагрузкой: где Gated DeltaNet проигрывает full attention

Гибридные модели обещают простую вещь. Память под контекст перестаёт расти линейно с его длиной, значит длинный контекст дешевеет, значит на ту же к…

vLLMKV-кешпрефиксное кешированиеGated DeltaNetгибридные моделиинференс LLMQwen3TTFTfp8llm
Habr
RU

350+ моделей без смены SDK: зачем разработчику слой абстракции над LLM‑провайдерами

Привет, Хабр! На связи команда Caila  — платформы Just AI, объединяющей LLM и другие генеративные модели, включая модели для создания…

LLMAPIOpenAI APIAnthropicClaudeAPI-гейтвейинтеграция с LLMvLLMбезопасность llmopenrouter
Habr
RU

Полез в исходники vLLM, чтобы понять, почему один символ убивает prompt caching

В первой части я вывел одно правило и предложил жить по нему: стабильное в начало, изменчивое в хвост , один символ в системном промпте обнуляет вес…

prompt cachingKV-cacheprefix cachingPagedAttentionvLLMLLMинференс LLMGPUprefillоптимизация
Habr
RU

Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front

Неважно, где ты гоняешь инференс: в проде на vLLM под нагрузкой или в локалке на llama.cpp, пытаясь втиснуть Llama-3 в 4 ГБ видеопамяти — вопрос все…

LLMинференсбенчмаркингvLLMllama.cppметрикивоспроизводимостьэнергоэффективностьпроизводительностьgpu
Habr
RU

[Перевод] Нехватка CUDA-памяти при обучении с GRPO: как перестать гадать и начать считать

Ошибка CUDA out of memory при обучении LLM обычно превращается в бесконечный цикл случайных правок: уменьшили batch size, урезали sequence length, с…

NLPLLMGRPOобучение с подкреплениемCUDA out of memoryvLLMоптимизация GPU памятидообучение моделейLoRAPyTorch
Habr
RU

Как мы собрали локальный AI-сервер на 4× RTX 4090 с водянкой — кейс для крупного клиента

Авантюра на 4× RTX 4090, два блока питания и водяное охлаждение - машину, которую мы собрали для крупного клиента, еле-еле подняли вдвоём. История о…

RTX 4090vLLMon-premiseлокальный AI серверлокальный ИИ серверводяное охлаждениеLLM inferenceGPU серверречевая аналитикаself-hosted LLM
Habr