RU

Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег

Для тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не&nb…

vLLMLiteLLMprefix cachingKV-cacheлокальные LLMинференс LLMQwenагентская разработкаRTX PRO 6000claude
Habr
RU

Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизация

На NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему б…

LLMархитектура LLMинференс LLMускорение LLMоптимизация LLMTransformerFlashAttentionKV-cacheквантизация LLMMixture of Experts
Habr
RU

Походка за двадцать минут и миллион рублей: что RL сделал с двуногими роботами и во что упёрся их «мозг»

За один 2026 год двуногие роботы успели пробежать полумарафон быстрее человеческого рекорда, довести публику до того, что CEO пришлось резать роботу…

reinforcement learningRL-локомоциягуманоидные роботыsim-to-realIsaac LabVLA-моделиPPOworld modelsробототехникаKV-cache
Habr
RU

Почему дорогая LLM дороже: экономика инференса, которую видно в твоём 5-часовом лимите

Каждый из вас, кто работал с Claude или с ChatGPT, смотрел на свои лимиты Или задавался вопросом «Да как один запрос съел 10% от лимита» Я потратил…

LLMMoEactive-параметрыKV-cacheинференс LLMoutput-токеныreasoning-токеныVRAMclaude codecodex
Habr
RU

Полез в исходники vLLM, чтобы понять, почему один символ убивает prompt caching

В первой части я вывел одно правило и предложил жить по нему: стабильное в начало, изменчивое в хвост , один символ в системном промпте обнуляет вес…

prompt cachingKV-cacheprefix cachingPagedAttentionvLLMLLMинференс LLMGPUprefillоптимизация
Habr
RU

Контекстное окно: почему нейросеть забывает части разговора

Представьте, что вы разговариваете с невероятно умным и эрудированным собеседником. Только очень странным. Несмотря на весь свой интеллект и тысячи…

контекстконтекстное окноLLMSelf-AttentionтокенLost in the MiddleRAGKV-cacheнейросетьвектор
Habr
RU

Скрытая цена LLM: как KV-cache увеличивает стоимость инференса и как эту проблему решает Google TurboQuant

При инференсе LLM общее потребление памяти определяется не только размером самой модели, но и промежуточными данными, накапливаемыми в процессе ее р…

LLMKV-cacheинференс LLMстоимость LLMоптимизация инференса