Приватная LLM в облаке: развертываем RAG-систему в Managed Kubernetes
Выход в продакшен с собственными языковыми моделями внутри корпоративного контура часто упирается в высокую стоимость GPU-оборудования и сложные рис…
Tech news from the best sources
Выход в продакшен с собственными языковыми моделями внутри корпоративного контура часто упирается в высокую стоимость GPU-оборудования и сложные рис…
В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, S…
This tutorial walks through installing and setting up the Rust toolchain for vLLM on an AWS EC2 G5g instance — Graviton2 (aarch64) with an NVIDIA T4…
This tutorial walks through installing and setting up the Rust toolchain for vLLM on an AWS EC2 G5g instance — Graviton2 (aarch64) with an NVIDIA T4…
A field report on serving Google's Gemma 4 E2B on AWS EC2 **G5g * — a Graviton2 (aarch64) host with an NVIDIA T4G (Turing, SM 7.5) GPU. Three obstac…
На YouTube очень часто мне попадаются видео, где сравнивают разные LLM для вайбкодеров: сделай 3D-аквариум с рыбками, напиши игру, слепи лендинг. Но…
Self-hosting a lite agent backend on one TPU chip A single Google Cloud TPU v5e chip — 16 GB of HBM, about $0.58/hour on spot — will serve google/ge…
Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является модел…
Представим на секунду, что есть проблема, которую над срочно пофиксить, в рабочем чате никто не отвечает, инженер, на котор…
Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…
Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT…
Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R‑Vision. В первой части эксперимента мы выяснили, как на …
Kimi K3 Open Weights Are Here: How to Self-Host the 2.8T-Parameter Model On July 27, 2026, Moonshot AI released the open weights for Kimi K3 -- a 2.…
Привет! Я Саша Рыжов, MLOps-инженер в hh.ru , уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые разви…
In LLM inference clusters, the core bottleneck for KV Cache storage acceleration often lies not in the storage medium itself, but in network bandwid…
Measured 2026-07-21 on vllm/vllm-tpu:nightly (vLLM 0.23.1rc1.dev1076), a GCE flex-start ct6e-standard-1t (one TPU v6e chip, 32 GB HBM) in europe-wes…
Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R-Vision. В этой статье разберем, почему для задач SOC можно начинать с…
TL;DR Short version: no. I dropped a much older GPU ( Quadro P2000, 5GB, Pascal, 2016 ) next to an RTX 3090 (24GB, Ampere) on the same box, ran the…
DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 …
Финал цикла про облачную LLM на 16 ГБ VRAM. За две предыдущие статьи мы подняли собственную локальную модель на облачном сервере с GPU на 16 ГБ VRAM…
Если вы в 2026 году запускаете LLM в продакшене, то почти наверняка больше всего денег тратите на инференс. Одна неоптимизированная модель размером…
Подняли DeepSeek‑V4‑Flash на двух GB10, упёрлись в потолок consumer Blackwell, прошли три тупика со спекулятивным декодингом — и в итоге получили па…
DGX Spark и его клоны поставляются с DGX OS (фактически, Ubuntu 24.04 с кучей дополнительных пакетов от Nvidia). Причем, драйвера используются довол…
NVIDIA published nvidia/Qwen3.6-35B-A3B-NVFP4 on May 28, 2026 — a post-training FP4-quantized variant of Alibaba's 35B MoE model that fits on a sing…
9 июня Anthropic выкатила Claude Fable 5 , он же Mythos 5 в закрытом контуре. 12 июня доступ к обеим версиям сняли. А между этими датами умест…
Если вы запускаете GPU-нагрузки (графические ускорители) на Kubernetes — vLLM, Triton, обучающие задачи или более новые стеки агентного инференса, —…
Six months ago, my team needed to deploy DeepSeek-R1 for internal use. We have a Kubernetes cluster — like everyone does in 2026 — so I started look…
Prefix caching at scale: when it saves you 80% of prefill cost, and the eviction policies that quietly turn it into 5% Your chatbot deploys 70B Llam…
KV cache quantization: what FP8/INT8 K and V actually buy you, and where they break You just deployed a 70B Llama fine-tune on 8x H100s, and your se…
Локальные LLM сейчас — это действительно мощный инструмент. Они уже вплотную приблизились к проприетарным моделям вроде Claude, особенно в задачах к…