RU

Кто работает, когда ничего не работает: от алерта до постмортема

Когда 20 ноября 2025 года из-за ошибки в конфигурации одного коммутатора отказала дисковая подсистема всей платформы, пятьдесят наших клиентов одновре…

инцидентинцидент-менеджменттехническая поддержкамониторингzabbixmonqоблака
Habr
RU

SLA как инструмент, а не отчёт

Это вторая часть разбора того, как мы выстраивали SLA и инцидент-менеджмент в большом продукте. В этой части речь пойдёт о следующем этапе — масштабир…

аналитикаbackendинцидент-менеджментslaуправление рискамимониторингдашбордынадежность сервисоврасчет потерьбизнес-аналитика