RU

Как и зачем ускоряют LLM

Мы знаем, что сегодняшние большие языковые модели основаны на архитектуре transformer , а самое важное понятие в трансформере это механизм attention…

kv cachecacheкешированиеускорить модель иикак ускорить иикак работает kv кешкеширование llmcache llmоптимизация трансформера
Habr
RU

Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…

vk cloudllm inferencekv cachegpu memoryoomlatency p99continuous batchingpaged attentionvllmtail latency
Habr
RU

Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…

vk cloudllm inferencekv cachegpu memoryoomlatency p99continuous batchingpaged attentionvllmtail latency
Habr
RU

[Перевод] Как оптимизировать LLM-инференс в 2026 году

Если вы в 2026 году запускаете LLM в продакшене, то почти наверняка больше всего денег тратите на инференс. Одна неоптимизированная модель размером…

оптимизация инференсаllm в продакшенеmlopsvllmkv cachepagedattentionprefix cachingквантованиеспекулятивный декодинг