RU

Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег

Для тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не&nb…

vLLMLiteLLMprefix cachingKV-cacheлокальные LLMинференс LLMQwenагентская разработкаRTX PRO 6000claude
Habr
RU

Полез в исходники vLLM, чтобы понять, почему один символ убивает prompt caching

В первой части я вывел одно правило и предложил жить по нему: стабильное в начало, изменчивое в хвост , один символ в системном промпте обнуляет вес…

prompt cachingKV-cacheprefix cachingPagedAttentionvLLMLLMинференс LLMGPUprefillоптимизация
Habr
RU

[Перевод] Как оптимизировать LLM-инференс в 2026 году

Если вы в 2026 году запускаете LLM в продакшене, то почти наверняка больше всего денег тратите на инференс. Одна неоптимизированная модель размером…

оптимизация инференсаllm в продакшенеmlopsvllmkv cachepagedattentionprefix cachingквантованиеспекулятивный декодинг
Habr
RU

Короткий промпт ≠ дешёвый промпт: как оптимизация ломает prefix cache в LLM-агентах

32 tools в промпте - дешевле, чем 7. Да, да - если вы строите агентов, это не опечатка. Это следствие того, как работает prefix cache в агентском ци…

llm-агентprefix cachingтокеныai-агентыaiprompt cachingprompt-engineeringcontext-engineering