RU

Распределённые вычисления: гарантия завершения на исполнителях, которые вам ничего не должны

Если вы ведете pet‑проекты, требующие большого количества вычислений, то наверняка сталкивались с проблемой их - вычислений - оркестрации. Содержать…

распределённые системыотказоустойчивостьMLOpsgpuархитектура повоспроизводимость моделейоркестрацияобучение моделейоблачные вычисленияпроектирование
Habr
RU

[Перевод] Масштабирование LLM: от одного чипа до ЦОДа. Глава 5. Инференс

Предыдущая глава Ну а теперь рассмотрим, как нам применить обученный трансформер. И применение уже обученной модели сильно отличается от тренировки,…

llmaimlgpugpu вычисленияанализ и проектирование системmlops
Habr
RU

Локальный ИИ-агент в своём контуре: Ollama плюс OpenClaw на серверном GPU

Однажды за один вечер мне пришлось разобрать двенадцать ошибок, и почти все прятались в конфигурации и связях между компонентами. Модель отвечала пу…

vk cloudлокальный ииai agentsollamaopenclawnvidia a30gpullm inferenceself-hosted aiинформационная безопасность
Habr
RU

Локальный ИИ-агент в своём контуре: Ollama плюс OpenClaw на серверном GPU

Однажды за один вечер мне пришлось разобрать двенадцать ошибок, и почти все прятались в конфигурации и связях между компонентами. Модель отвечала пу…

vk cloudлокальный ииai agentsollamaopenclawnvidia a30gpullm inferenceself-hosted aiинформационная безопасность
Habr
RU

Новинки серверного железа в июле: новые процессоры AMD EPYC 9006 Venice и тотальное жидкостное охлаждение

В июле 2026 вышло сразу несколько продуктов, которые демонстрируют две тенденции. Первая: воздушное охлаждение окончательно перестает справляться, и…

selectelcpussdpcie 6.0серверыamdintelkioxiagpuии
Habr
RU

MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-…

llama.cppmoertx 5090пропускная способность памятиcudagpuинференс ллмбенчмаркпрофилированиеqwen 3.5
Habr
RU

Как оптимизировать расходы на инфраструктуру для искусственного интеллекта. Выбираем железо и модели под разные задачи

В отчете The State of AI 2025 агентство McKinsey заявляет, что 88% компаний уже используют ИИ хотя бы в одном бизнес-процессе. Grand View Research о…

selectelискусственный интеллектсерверыоптимизацияllmgpumlit-инфраструктуравнедрение ии
Habr
RU

Паравиртуализация при отладке графических приложений KasperskyOS в QEMU

Привет! Меня зовут Денис Молодяков, я — тимлид команды графики в KasperskyOS . Мы отвечаем за разработку графического стека полного цикла для микроя…

gpuvirtiociсистемное программированиепаравиртуализациямикроядроwaylandkasperskyosqemuвиртуализация
Habr
RU

[Перевод] Масштабирование LLM: от одного чипа до ЦОДа. Глава 4. Тренировка трансформера

Наконец-то мы добрались непосредственно до того, как тренировать трансформер, не просто тренировать, а делать это эффективно и масштабируемо. Как мы…

llmaimlgpugpu вычисленияанализ и проектирование систем
Habr
RU

Подводные камни ИИ-инфраструктуры: что узнаёт заказчик через полгода после запуска (и как мы предусмотрели это в ПАК)

Привет, Хабр! Меня зовут Алексей, я архитектор в команде Скала^р (входим в Группу Rubytech). Мы разрабатываем программно-аппаратные комплексы (ПАК)…

gpullmrdmaинференсии-инфраструктурапрограммно-аппаратный комплекссамосборcudanvidiapytorch
Habr
RU

Под с GPU не лечится рестартом: устраиваем отказ устройства в кубере и чиним без вечного Pending

В 2024 году была опубликована интересная статья , в которой описано, как за 54 дня обучения Llama 3 405B кластер Meta из 16 384 карт H100 пережил 41…

vk cloudkubernetesgpudradevice pluginpod failurependingtaintsresourceclaimотказоустойчивость
Habr
RU

Под с GPU не лечится рестартом: устраиваем отказ устройства в кубере и чиним без вечного Pending

В 2024 году была опубликована интересная статья , в которой описано, как за 54 дня обучения Llama 3 405B кластер Meta из 16 384 карт H100 пережил 41…

vk cloudkubernetesgpudradevice pluginpod failurependingtaintsresourceclaimотказоустойчивость
Habr
RU

От ANN к честному KNN на GPU: как мы пересобрали отбор кандидатов в рекомендациях Ozon

Привет! Мы команда рекомендательной системы Ozon, и сегодня мы хотим рассказать о нашем пути от приближённого поиска соседей (ANN) к точному KNN на…

annrecsysbigdataretrievalknnsparkpytorchgpuрекомендательные системыozon tech
Habr
RU

Локальный запуск LLM для SOC: сколько инцидентов обработает одна GPU? Часть 2

Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R‑Vision. В первой части эксперимента мы выяснили, как на&nbsp…

llmsocgpuавтоматизация SOCnvidia rtx pro 6000 blackwellvllmqwen3.5AI в SOCинференс llmself-hosted llm
Habr
RU

Разворачиваем MiniMax-M2.7 на GPU-инфраструктуре с поддержкой S3

Использовать нейросети для работы с внутренними данными компании — идея классная, но скармливать их внешним API банально опасно. Никому не хочется,…

mlselectelit-компанииit-инфраструктураs3-хранилищеminimax m2.7gpuии
Habr
RU

Инференс с дешевой памятью, 128-ядерные RISC-V и другие новинки из мира железа: дайджест июня

Июнь выдался плотным: Qualcomm придумала замену HBM памяти в GPU, развивается PCIe 6.0, а китайцы прогнали 51 Тбит/с по полой трубке из стекла. Разб…

selectelit-компанииit-инфраструктураdigestсерверыcpugpussdсети
Habr
RU

Локальный запуск LLM для SOC: сколько GPU действительно нужно?

Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R-Vision. В этой статье разберем, почему для задач SOC можно начинать с…

llm-моделилокальный запуск llmvllmqwengpuNVIDIA RTX PRO 6000 Blackwellsocsoarai в кибербезопасности
Habr
RU

Коробка с нейросетями: готовая ИИ-инфраструктура, которая просто работает

Привет, Хабр! В день, когда весь мир в очередной раз обсуждает «умные» ассистенты, генеративные сети и спорит, заменит ли ИИ разработчиков, хочется…

к2 нейротехпак-mlии-инфраструктураon-premiseпрограммно-аппаратный комплексвысоконагруженные вычисленияискусственный интеллектmlopsgpuвсемирный день ии
Habr
RU

Как мы вынесли семантический поиск на обычный сервер без видеокарты, облака и выделенной поисковой системы

Когда мы занялись поисковым слоем AI-ассистента в «Первой Форме», договорились на входе: языковую модель, которая отвечает пользователю, не трогаем.…

llmaigpucpuqwenon-premiseenterprisebpmslow-code
Habr
RU

Hermes + Qwen3.6-27B: как я собрал первую линию email-поддержки

Я решил в качестве эксперимента собрать первую линию email-поддержки вокруг локальной LLM — без файн-тюнинга и попыток сразу заменить всю службу под…

hermesqwen3.6qwenhelpdeskagentоблачная инфраструктураgpuаренда gpurtx5090поддержка пользователей
Habr
RU

Всё, что вы хотели знать про локальные LLM, но боялись заинференсить

LLM может влезать в контекст и генерировать 200 tok/s, но если она не может найти нужный факт в тексте, толку от этого мало. Поэтому мы захостили 8…

квантованиеllmбенчмаркиоблачная инфраструктураgpurtx 5090большие языковые модели
Habr
RU

AI ready: почему дата-центр для ИИ сложнее обычного модульного ЦОДа

В первой статье я рассказал, как мы пришли к идее AI ready — локального контура, который собирает инженерную базу, вычисления и прикладной ИИ в одну…

искусственный интеллектaiэнергетикавычисленияжидкостное охлаждениеdirect-to-chipgpuдата-центрнагрузка на стойкуцод
Habr