AVM изнутри задачи, сбои и состояние виртуальных машин
В первой части мы разобрали, почему Aeza ушла со сторонней платформы и как AVM устроен в общих чертах. Здесь уровень ниже: путь запроса от вызова до…
Tech news from the best sources
В первой части мы разобрали, почему Aeza ушла со сторонней платформы и как AVM устроен в общих чертах. Здесь уровень ниже: путь запроса от вызова до…
Ранее в " Надёжность, устойчивость, доступность " провели введение в терминологию надежности. В этой статье рассмотрим типовые модели отказоустойчив…
Если вы ведете pet‑проекты, требующие большого количества вычислений, то наверняка сталкивались с проблемой их - вычислений - оркестрации. Содержать…
SDS-кластер, собранный на глазок и прошедший приёмочные тесты, вполне может проработать полгода без единой жалобы, а потом упереться в стену. Причин…
Всем привет! Я Андрей Халиуллин — руководитель направления IAM & Security Services в MWS Cloud Platform, и мы продолжаем делать облако. В этот р…
Привычные термины становятся все более запутанными. Если раннее (до 2003 года) система ГОСТ еще была фундаментальна и системно выстроена (…
Набор тестов, который всегда зелёный, содержит непроверяемое допущение: он может ловить ошибки, а может не смотреть вообще — по цвету это неразличим…
Фискальный накопитель печатает чек — и связь обрывается до того, как пришёл ответ. Напечатался он или нет, узнать неоткуда: обе ситуации выглядят дл…
База данных — бизнес-критический компонент любой ИТ-инфраструктуры, поэтому вопрос обеспечения ее доступности и отказоустойчивости обычно находится…
Мы делаем RCQ , мессенджер со сквозным шифрованием и открытым кодом ( Android , iOS , протокол ). В нашем основном регионе приложе…
Система прошла приёмку, но первая реальная нагрузка разогнала p99, исчерпала пул соединений и увеличила счёт за облако. Разбираем пять оши…
Webhook часто воспринимают как простой механизм доставки уведомлений: пришло событие — обработали — вернули 200. На практике име…
Микросервисы обещают независимость и гибкость, но вместе с этим добавляют новый класс проблем: задержки между сервисами, каскадные сбои и…
В 2024 году была опубликована интересная статья , в которой описано, как за 54 дня обучения Llama 3 405B кластер Meta из 16 384 карт H100 пережил 41…
В 2024 году была опубликована интересная статья , в которой описано, как за 54 дня обучения Llama 3 405B кластер Meta из 16 384 карт H100 пережил 41…
Пользователи из регионов начали писать в поддержку одно и то же: приложение не открывается. Симптомы у всех разные. У кого-то вечная загрузка, у ког…
На первый взгляд балансировка кластера NGFW мало отличается от балансировки других средств информационной безопасности или ИТ-сервисов. Однако на пр…
В распределённых системах генерация уникальных ID быстро становится архитектурной задачей: центральная база создаёт узкое место, а переход на UUID м…
Короткая история про то, как штатная замена ноды оставила quorum-очереди с двумя членами вместо трёх, и почему cluster_status этого не показывает. С…
Надежная ИТ-инфраструктура как здоровье – пока она есть, ее никто не замечает. Но за четверть века подходы к реализации ее надежности сильно поменял…
Привет, Хабр! Меня зовут Артем Токарь, я младший инженер технической поддержки в К2 Кибербезопасность . Наша команда работает в составе Це…
Когда сайт перестаёт отвечать, причина не всегда находится внутри VPS или у хостинг-провайдера. За одной виртуальной машиной стоит длинная цепочка:…
В этой статье хочу поделиться практическим опытом проектирования и внедрения защиты частного облака, размещённого на двух географически разнесённых…
Я проектирую системы на LLM, и после каждого громкого ИИ‑инцидента мне прилетает одна и та же ссылка с одним и тем же вопросом:…
Когда инфраструктура начинает сбоить, причина редко остаётся в одном слое: за проблемой с деплоем тянутся пайплайны, контейнеры и секреты, а за дегр…
Привет, Хабр! Меня зовут Михаил Косцов, я руководитель практики вычислительной инфраструктуры, СХД и СРК К2Тех. Для нас серверное железо – рабочий и…
Есть паттерн, который я вижу почти в каждом кластере, куда прихожу: liveness-проба, скопированная из туториала, которая годами тихо делает продакшен…
Редкий сбой в распределённой системе может месяцами ускользать от команды, а при попытке воспроизведения исчезать из‑за изменивш…
Высокий приоритет пода в Kubernetes должен повышать устойчивость сервиса, но при ошибочной настройке ресурсов может запустить противо…
ИИ-агент может написать убедительный ответ и при этом вызвать не тот инструмент, потерять состояние между ходами или принять неверное решение с высо…