RU

Hermes c локальными LLM vs GigaCode: сравниваем агентов на реальных PHP/Symfony-задачах

На YouTube очень часто мне попадаются видео, где сравнивают разные LLM для вайбкодеров: сделай 3D-аквариум с рыбками, напиши игру, слепи лендинг. Но…

PHPSymfonyGigaCodeHermesvllmагентное программированиелокальные llm
Habr
RU

Ускорение инференса энкодерной guard‑модели: TensorRT, Triton, vLLM, Ray Serve

Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является модел…

gliner2gliner guardguardrailstensorrtvllmnvidiaинференс нейросетейtriton-inference-server
Habr
RU

Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…

vk cloudllm inferencekv cachegpu memoryoomlatency p99continuous batchingpaged attentionvllmtail latency
Habr
RU

Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…

vk cloudllm inferencekv cachegpu memoryoomlatency p99continuous batchingpaged attentionvllmtail latency
Habr
RU

Локальный запуск LLM для SOC: сколько инцидентов обработает одна GPU? Часть 2

Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R‑Vision. В первой части эксперимента мы выяснили, как на&nbsp…

llmsocgpuавтоматизация SOCnvidia rtx pro 6000 blackwellvllmqwen3.5AI в SOCинференс llmself-hosted llm
Habr
RU

Локальный запуск LLM для SOC: сколько GPU действительно нужно?

Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R-Vision. В этой статье разберем, почему для задач SOC можно начинать с…

llm-моделилокальный запуск llmvllmqwengpuNVIDIA RTX PRO 6000 Blackwellsocsoarai в кибербезопасности
Habr
RU

DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10&nbsp…

dgx sparkdeepseekvllmспекулятивный декодингspeculative decodingdsparkllm-инференсбенчмаркиnvfp4nvfp8
Habr
RU

[Перевод] Как оптимизировать LLM-инференс в 2026 году

Если вы в 2026 году запускаете LLM в продакшене, то почти наверняка больше всего денег тратите на инференс. Одна неоптимизированная модель размером…

оптимизация инференсаllm в продакшенеmlopsvllmkv cachepagedattentionprefix cachingквантованиеспекулятивный декодинг
Habr
RU

DeepSeek‑V4‑Flash на двух DGX Spark: как мы убрали очередь и получили multi‑user

Подняли DeepSeek‑V4‑Flash на двух GB10, упёрлись в потолок consumer Blackwell, прошли три тупика со спекулятивным декодингом — и в итоге получили па…

dgx sparkvllmdeepseek-v4gb10tensor parallelAGmindllm inferenceспекулятивный декодинг
Habr
RU

Anthropic, Fable 5, Claude Code и большой отбор игрушек

9 июня Anthropic выкатила  Claude Fable 5 , он же Mythos 5 в закрытом контуре. 12 июня доступ к обеим версиям сняли. А между этими датами умест…

claude fable 5mythos 5anthropicllmлокальные моделиvllmollamahugging faceуправление зависимостямиИИ-безопасность
Habr
RU

Qwen3.5 на двух V100, reverse SSH вместо Cloudflare в Telegram Mini App: собираю AI-репетитора английского

У меня в углу комнаты стоит сервер с двумя Tesla V100 32GB. Они доcтались мне для другой задачи, которая отвалилась, и полгода стояли мёртвым грузом…

vllmqwen3.5telegram bottelegram mini appsaiogram 3fastapiself-hosted llmkokoro ttswhispertesla v100
Habr
RU

DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан

NVIDIA продаёт спарку с лозунгом «один петафлоп на FP4». Я купил коробку, поставил vLLM, запустил инференс и получил 40 токенов в&nbs…

vllmdgx sparkgb10blackwellnvfp4llmинференслокальный ии
Habr