RU

Знания нельзя втолкнуть туда, где они не нужны

Ко мне однажды направили технаря перенимать опыт инцидент-менеджмента. Он возглавлял инженерную команду в розничной сети с большим количеством распр…

обмен знаниямипередача знанийлучшие практикиинцидент-менеджментknowledge management
Хабр — Управление
RU

Как научить ИИ разгребать метрики, пока дежурный допивает чай

Полчаса паники, десяток дашбордов и один вопрос без ответа: что вообще происходит. Именно столько в среднем уходит на то, чтобы просто подтвердить и…

AI-агентинцидент-менеджментDevOpsKubernetesLLMмониторингAlertmanagerавтоматизация инцидентовСлёрм
Habr
RU

Как мониторить Java-приложения: метрики, алерты и правило 80/20

Хороший мониторинг помогает быстро понять, что происходит с приложением и куда смотреть в первую очередь. Для этого не нужно пытаться измерить всё:…

мониторингметрикиалертингjavadevopssresite reliability engineeringнадежностьинцидент-менеджмент
Habr
RU

Последние из серверной: почему эпоха трушных сисадминов заканчивается (или только начинается)

Всегда считал системных администраторов здоровой профессией. Нормальные мужики, которые ругались матом и знали жизнь. Почти всю работу выполняли вру…

TrelloЯндекс Трекерсисадминкорпадминкорпоративный администраторинцидент-менеджментконтейнерыдевопсыимпорт тикетов
Habr
RU

Кто работает, когда ничего не работает: от алерта до постмортема

Когда 20 ноября 2025 года из-за ошибки в конфигурации одного коммутатора отказала дисковая подсистема всей платформы, пятьдесят наших клиентов однов…

инцидентинцидент-менеджменттехническая поддержкамониторингzabbixmonqоблака
Habr
RU

Зоопарк протоколов и человеческий фактор: что внутри сложной IoT-интеграции климатического оборудования

Мониторинг температуры в холодильном оборудовании кажется простой задачей. Особенно если речь идет всего о нескольких десятках ларей на одном произв…

iotпромышленный интернет вещеймониторингalertingMESпроизводствобеспроводные датчикиинцидент-менеджментЛАНИТ
Habr
RU

[Перевод] ИИ-агент запустил Terraform и снёс прод: как я восстанавливал базу

Типовая ситуация: Terraform-конфигурация выглядит привычно, а ИИ-агент экономит время на рутинных операциях. Но потерянный state-файл и один terrafo…

TerraformClaude CodeИИ-агентыAWSудаление продакшенавосстановление базы данныхрезервное копированиеTerraform stateинцидент-менеджментзащита инфраструктуры
Habr
RU

SLA как инструмент, а не отчёт

Это вторая часть разбора того, как мы выстраивали SLA и инцидент-менеджмент в большом продукте. В этой части речь пойдёт о следующем этапе — масштаб…

аналитикаbackendинцидент-менеджментslaуправление рискамимониторингдашбордынадежность сервисоврасчет потерьбизнес-аналитика
Habr
RU

SLA как инструмент, а не отчёт. Часть 1. Как подружить бизнес и инженеров через общие цифры

Наш прежний SLA формально выглядел корректно: была формула, «четыре девятки» и отчёты. Но в моменты сбоев это не помогало ответить бизнесу на вопрос…

инцидент-менеджментslabackendуправление рискамианалитикамониторингвременные рядыдашбордынадежность сервисоврасчет потерь
Habr
RU

Культура инцидентов. Почему поиск виновных на постмортемах убивает надёжность системы

Когда прод падает, первый управленческий рефлекс — найти человека, после которого всё сломалось. Проблема в том, что такой разбор поч…

postmortemblameless cultureинцидент-менеджментSREerror budgeton-callнадёжность системинженерная культуратехнический менеджментразбор инцидентов