RU

Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…

vk cloudllm inferencekv cachegpu memoryoomlatency p99continuous batchingpaged attentionvllmtail latency
Habr
RU

Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…

vk cloudllm inferencekv cachegpu memoryoomlatency p99continuous batchingpaged attentionvllmtail latency
Habr
RU

Разбор утечки памяти в StackExchange.Utils: как 4 КБ конфигурации съели 2 ГБ RAM

Привет, Хабр! Я Антон Пронькин, разработчик в команде развития сервисов продаж для юридических лиц в Т-Банке. Расскажу, как мы переносили конфигурац…

траблшутингутечка памятиramпрофайлингoomбиблиотекаc#
Habr