RU

Как мы добавили Global Orchestration в IncidentRelay: маршрутизация алертов до создания инцидента

Когда система мониторинга отправляет алерт, он редко выглядит так, как хотелось бы дежурному инженеру. Один источник пишет critical , другой — disas…

incident managementalert routingon-callSREDevOpsopen sourceself-hostedIncidentRelay
Habr
RU

Культура инцидентов. Почему поиск виновных на постмортемах убивает надёжность системы

Когда прод падает, первый управленческий рефлекс — найти человека, после которого всё сломалось. Проблема в том, что такой разбор поч…

postmortemblameless cultureинцидент-менеджментSREerror budgeton-callнадёжность системинженерная культуратехнический менеджментразбор инцидентов