RU

Локальный ИИ-агент в своём контуре: Ollama плюс OpenClaw на серверном GPU

Однажды за один вечер мне пришлось разобрать двенадцать ошибок, и почти все прятались в конфигурации и связях между компонентами. Модель отвечала пу…

vk cloudлокальный ииai agentsollamaopenclawnvidia a30gpullm inferenceself-hosted aiинформационная безопасность
Habr
RU

Локальный ИИ-агент в своём контуре: Ollama плюс OpenClaw на серверном GPU

Однажды за один вечер мне пришлось разобрать двенадцать ошибок, и почти все прятались в конфигурации и связях между компонентами. Модель отвечала пу…

vk cloudлокальный ииai agentsollamaopenclawnvidia a30gpullm inferenceself-hosted aiинформационная безопасность
Habr
RU

Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…

vk cloudllm inferencekv cachegpu memoryoomlatency p99continuous batchingpaged attentionvllmtail latency
Habr
RU

Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…

vk cloudllm inferencekv cachegpu memoryoomlatency p99continuous batchingpaged attentionvllmtail latency
Habr
RU

DeepSeek‑V4‑Flash на двух DGX Spark: как мы убрали очередь и получили multi‑user

Подняли DeepSeek‑V4‑Flash на двух GB10, упёрлись в потолок consumer Blackwell, прошли три тупика со спекулятивным декодингом — и в итоге получили па…

dgx sparkvllmdeepseek-v4gb10tensor parallelAGmindllm inferenceспекулятивный декодинг