RU

11 минут у Backblaze, и неделя бездействия у reg.ru: как компании обрубают инфраструктуру трояна в России и за рубежом

Привет, хабр. Если вы состоите в более-менее крупных ТГ сообществах, то наверняка замечали, как время от времени в чатах мелькают боты с предложение…

вирусывирусный анализинцидентыинциденты-ибинциденты безопасностибезопасностькомпании itреакция компанийспамспам в социальных сетях
Habr
RU

Тимлид и subnet-полукровка: как одна строчка в YAML стоила $50 000 и двенадцати часов прода

Однажды, морозным ноябрьским утром 2024 года, я, как новоиспечённый тимлид не такой уж и маленькой команды, поверил в себя и в то, что спустя полгод…

awscloudformationaws cdkпостмортемaurorardsiacинцидентыvpcdevops
Habr
RU

Качественный и количественный анализ инцидентов в России за 2020–2025 годы

Мы уже обсуждали общий ландшафт кибератак и защитных стратегий ИБ в 2020–2025 годах в нашей статье на Хабре . Тогда мы описали сдвиг от публичных вы…

газинформсервисинформационная безопасностьинцидентыкибератаки
Habr
RU

Мы чинили инциденты всё быстрее — а недовольство клиентов росло. Почему MTBF важнее MTTR

Инцидентов стало в два раза больше. Время восстановления сократилось вдвое. Uptime сервисов держался в норме. По всем ключевым метрикам мы становили…

mtbfmttrsreнадежностьметрикиинцидентыуправление разработкой
Хабр — Управление
RU

Сократили цикл разработки на 20% — и получили вдвое больше инцидентов

В продуктовой B2B-компании, где я отвечал за надёжность, поставили амбициозную цель: сократить цикл разработки (dev cycle time) на 20%. Забегая впер…

контрметрикиsreметрикинадёжностьуправление разработкойинцидентыdev cycle time
Habr
RU

Как российские хостинги (и нас особенно) знатно штормило в мае-июне, и почему некоторые теперь не пишут на Хабре

За два месяца на индустрию высыпалось очень много неприятностей. Из голландского ЦОДа кто-то атаковал правительственные сервисы ЕС, и там сделали ма…

хостингдата-центрыинцидентыизъятие серверовddos-атакисерверное оборудованиерезервное копированиеSLAинфраструктурахостинг-провайдер
Хабр — Управление
RU

0 дней без инцидента. Расследуем атаку и восстанавливаемся после неё

Привет! В первой части, «Как и чем ломали российские компании» , мы рассказали о тактиках и техниках злоумышленников, а также о том, как вовремя обн…

информационная безопасностьибинцидентыреагирование на инцидентырезервное копированиевосстановление данныхрасследованиевредоносутечкаутечка данных
Habr
RU

Инциденты под контролем: дежурный бот, MAX и путь к SRE-помощнику

Привет, это снова Максим Королёв из Петрович-ТЕХ — сервисный менеджер, который автоматизирует всё, до чего дотянутся руки. Сегодня расскажу, как бот…

ботmaxsreitsmинцидентысистемное администрированиеcoreпараллельная рассылкаreply_fn
Habr
RU

Ваши постмортемы — это поминки. И добрая половина процессов в компании тоже

Однажды я зашёл в компанию через неделю после крупного падения и попросил показать постмортем. Мне показали — с гордостью. Таймлайн поминутно, five…

постмортемнадежностьreliabilityинцидентыуправление разработкойинженерная культураретроспективатехнический долгуправление командой
Хабр — Управление
RU

Сбой у Yandex Cloud

Сегодняшний инцидент войдет в историю как интересный кейс «ошибки начисления». Чтобы спасти пользователей от некорректных списаний, облако просто за…

инциденты
Habr
RU

Пять самых крупных ошибок, которые допускают компании при внедрении SRE

SRE часто внедряют как набор инструментов, дашбордов и новых должностей, но через полгода команда всё так же тушит инциденты по ночам, а бюджеты оши…

Site Reliability EngineeringSREнадежность системраспределенные системымониторингobservabilitysloбюджет ошибокинциденты
Habr
RU

Между нами SLA: как бизнесу и поддержке договориться до первого инцидента

Разбор SLA от человека, которого подключают, когда сайт недоступен, заказы не проходят, а в чатах уже ищут виноватых. Рассказываю, как SLA помогает…

системное администрированиеdevopsslaтехническая поддержкамониторинг сервераинцидентыревью кодарефакторингаварийное восстановлениеаварийные ситуации