RU

Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…

vk cloudllm inferencekv cachegpu memoryoomlatency p99continuous batchingpaged attentionvllmtail latency
Habr
RU

Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…

vk cloudllm inferencekv cachegpu memoryoomlatency p99continuous batchingpaged attentionvllmtail latency