RU

Распределённые вычисления: гарантия завершения на исполнителях, которые вам ничего не должны

Если вы ведете pet‑проекты, требующие большого количества вычислений, то наверняка сталкивались с проблемой их - вычислений - оркестрации. Содержать…

распределённые системыотказоустойчивостьMLOpsgpuархитектура повоспроизводимость моделейоркестрацияобучение моделейоблачные вычисленияпроектирование
Habr
RU

[Перевод] Масштабирование LLM: от одного чипа до ЦОДа. Глава 5. Инференс

Предыдущая глава Ну а теперь рассмотрим, как нам применить обученный трансформер. И применение уже обученной модели сильно отличается от тренировки,…

llmaimlgpugpu вычисленияанализ и проектирование системmlops
Habr
RU

Локальный ИИ-агент в своём контуре: Ollama плюс OpenClaw на серверном GPU

Однажды за один вечер мне пришлось разобрать двенадцать ошибок, и почти все прятались в конфигурации и связях между компонентами. Модель отвечала пу…

vk cloudлокальный ииai agentsollamaopenclawnvidia a30gpullm inferenceself-hosted aiинформационная безопасность
Habr
RU

Локальный ИИ-агент в своём контуре: Ollama плюс OpenClaw на серверном GPU

Однажды за один вечер мне пришлось разобрать двенадцать ошибок, и почти все прятались в конфигурации и связях между компонентами. Модель отвечала пу…

vk cloudлокальный ииai agentsollamaopenclawnvidia a30gpullm inferenceself-hosted aiинформационная безопасность
Habr
RU

Новинки серверного железа в июле: новые процессоры AMD EPYC 9006 Venice и тотальное жидкостное охлаждение

В июле 2026 вышло сразу несколько продуктов, которые демонстрируют две тенденции. Первая: воздушное охлаждение окончательно перестает справляться, и…

selectelcpussdpcie 6.0серверыamdintelkioxiagpuии
Habr
RU

MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-…

llama.cppmoertx 5090пропускная способность памятиcudagpuинференс ллмбенчмаркпрофилированиеqwen 3.5
Habr
RU

Как оптимизировать расходы на инфраструктуру для искусственного интеллекта. Выбираем железо и модели под разные задачи

В отчете The State of AI 2025 агентство McKinsey заявляет, что 88% компаний уже используют ИИ хотя бы в одном бизнес-процессе. Grand View Research о…

selectelискусственный интеллектсерверыоптимизацияllmgpumlit-инфраструктуравнедрение ии
Habr
RU

Паравиртуализация при отладке графических приложений KasperskyOS в QEMU

Привет! Меня зовут Денис Молодяков, я — тимлид команды графики в KasperskyOS . Мы отвечаем за разработку графического стека полного цикла для микроя…

gpuvirtiociсистемное программированиепаравиртуализациямикроядроwaylandkasperskyosqemuвиртуализация
Habr
RU

[Перевод] Масштабирование LLM: от одного чипа до ЦОДа. Глава 4. Тренировка трансформера

Наконец-то мы добрались непосредственно до того, как тренировать трансформер, не просто тренировать, а делать это эффективно и масштабируемо. Как мы…

llmaimlgpugpu вычисленияанализ и проектирование систем
Habr
RU

Подводные камни ИИ-инфраструктуры: что узнаёт заказчик через полгода после запуска (и как мы предусмотрели это в ПАК)

Привет, Хабр! Меня зовут Алексей, я архитектор в команде Скала^р (входим в Группу Rubytech). Мы разрабатываем программно-аппаратные комплексы (ПАК)…

gpullmrdmaинференсии-инфраструктурапрограммно-аппаратный комплекссамосборcudanvidiapytorch
Habr
RU

Под с GPU не лечится рестартом: устраиваем отказ устройства в кубере и чиним без вечного Pending

В 2024 году была опубликована интересная статья , в которой описано, как за 54 дня обучения Llama 3 405B кластер Meta из 16 384 карт H100 пережил 41…

vk cloudkubernetesgpudradevice pluginpod failurependingtaintsresourceclaimотказоустойчивость
Habr
RU

Под с GPU не лечится рестартом: устраиваем отказ устройства в кубере и чиним без вечного Pending

В 2024 году была опубликована интересная статья , в которой описано, как за 54 дня обучения Llama 3 405B кластер Meta из 16 384 карт H100 пережил 41…

vk cloudkubernetesgpudradevice pluginpod failurependingtaintsresourceclaimотказоустойчивость
Habr