RU

Дело о 38 токенах в секунду: почему M3 Ultra начинал с двенадцати

Всё началось с простой, на первый взгляд, задачи. Я хотел использовать локально Qwen3.8-27B именно в BF16. Причём не исходный PyTorch-чекпойнт через…

Qwen3.8-27BDFlash2oMLXMLXApple SiliconMac Studio M3 Ultraлокальные LLMинференс LLMspeculative decodingBF16
Habr
RU

Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег

Для тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не&nb…

vLLMLiteLLMprefix cachingKV-cacheлокальные LLMинференс LLMQwenагентская разработкаRTX PRO 6000claude
Habr
RU

Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизация

На NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему б…

LLMархитектура LLMинференс LLMускорение LLMоптимизация LLMTransformerFlashAttentionKV-cacheквантизация LLMMixture of Experts
Habr
RU

Гибридные трансформеры под нагрузкой: где Gated DeltaNet проигрывает full attention

Гибридные модели обещают простую вещь. Память под контекст перестаёт расти линейно с его длиной, значит длинный контекст дешевеет, значит на ту же к…

vLLMKV-кешпрефиксное кешированиеGated DeltaNetгибридные моделиинференс LLMQwen3TTFTfp8llm
Habr
RU

Почему дорогая LLM дороже: экономика инференса, которую видно в твоём 5-часовом лимите

Каждый из вас, кто работал с Claude или с ChatGPT, смотрел на свои лимиты Или задавался вопросом «Да как один запрос съел 10% от лимита» Я потратил…

LLMMoEactive-параметрыKV-cacheинференс LLMoutput-токеныreasoning-токеныVRAMclaude codecodex
Habr
RU

Полез в исходники vLLM, чтобы понять, почему один символ убивает prompt caching

В первой части я вывел одно правило и предложил жить по нему: стабильное в начало, изменчивое в хвост , один символ в системном промпте обнуляет вес…

prompt cachingKV-cacheprefix cachingPagedAttentionvLLMLLMинференс LLMGPUprefillоптимизация
Habr
RU

Скрытая цена LLM: как KV-cache увеличивает стоимость инференса и как эту проблему решает Google TurboQuant

При инференсе LLM общее потребление памяти определяется не только размером самой модели, но и промежуточными данными, накапливаемыми в процессе ее р…

LLMKV-cacheинференс LLMстоимость LLMоптимизация инференса