RU

Redis — история одного падения

Пару лет назад мы устроили настоящее расследование серии инцидентов в поисках скрытого дефекта нашего Redis-клиента. Команда воспроизводила сбои под…

javaredisjedissredowntime
Habr
RU

Как я перестал гадать, какая пара нод сломалась после апдейта CNI, и написал для этого свой мониторинг

98% успешных проверок в дашборде выглядят прекрасно. Ровно до момента, когда доходит: недостающие 2% это одна пара нод, один протокол, и т…

kubernetesmonitoringsredevopsgoobservabilityopensource
Habr
RU

ИИ в эксплуатации (AIOps): разбор алертов и автоматизация инцидентов

В марте 2025 года Gartner сделал то, чего индустрия ждала несколько лет: официально переименовал категорию AIOps в Event Intelligence Solutions. При…

aiopsEvent Intelligenceразбор алертовавтоматизация инцидентовалерт-фатигадедупликация алертовобнаружение аномалийprometheusalertmanagersre
Habr
RU

На вкус и цвет все фломастеры разные — способы управления средами на личном опыте

Знаешь , я прочитал ту статью про инфраструктурные релизы, идентичность и консистентность. Красиво написано, складно. Прямо как в душноватом учебник…

инфраструктурасреды разработкиdevopssre
Habr
RU

Как мониторить Java-приложения: метрики, алерты и правило 80/20

Хороший мониторинг помогает быстро понять, что происходит с приложением и куда смотреть в первую очередь. Для этого не нужно пытаться измерить всё:…

мониторингметрикиалертингjavadevopssresite reliability engineeringнадежностьинцидент-менеджмент
Habr
RU

Мы чинили инциденты всё быстрее — а недовольство клиентов росло. Почему MTBF важнее MTTR

Инцидентов стало в два раза больше. Время восстановления сократилось вдвое. Uptime сервисов держался в норме. По всем ключевым метрикам мы становили…

mtbfmttrsreнадежностьметрикиинцидентыуправление разработкой
Хабр — Управление
RU

Заменили ноду в кластере RabbitMQ — и через месяц потеряли регион OpenStack

Короткая история про то, как штатная замена ноды оставила quorum-очереди с двумя членами вместо трёх, и почему cluster_status этого не показывает. С…

rabbitmqopenstackquorum queueskolla-ansibleотказоустойчивостькластеризацияcinderпостмортемsreинцидент
Habr
RU

Сократили цикл разработки на 20% — и получили вдвое больше инцидентов

В продуктовой B2B-компании, где я отвечал за надёжность, поставили амбициозную цель: сократить цикл разработки (dev cycle time) на 20%. Забегая впер…

контрметрикиsreметрикинадёжностьуправление разработкойинцидентыdev cycle time
Habr
RU

FinOps на практике. Серия 2: от пилота к регламентам, или как удержать экономию на облаке

Это вторая статья цикла. В первой части мы разбирали, как начать FinOps с точки ноль: посадить финансы и инженеров за один стол, договориться об общ…

finopscloud costcloud billingcost allocationshowbackresource taggingcloud infrastructuredevopssrekubernetes
Habr
RU

Книга: «Основы DevOps и Software Delivery. Практика развертывания и сопровождения ПО в продакшене»

Привет, Хаброжители! В то время как в большинстве книг о DevOps лишь поверхностно рассматриваются теория и культура, в этом практическом руководстве…

devopssoftware deliverysrednsvpcфулстек-разработка
Habr
RU

[Перевод] Когда AOL перестал работать (1996)

Представьте, что вы перенеслись в 7 августа 1996 года. Закройте глаза и вообразите мир, где напряжённость в отношениях с Россией, Китаем и Ближним В…

инженерияaolсбоиsresre-инженерсистемы связиинтернет-технологииit-инфраструктураподдержка пользователейистория it
Habr
RU

Инциденты под контролем: дежурный бот, MAX и путь к SRE-помощнику

Привет, это снова Максим Королёв из Петрович-ТЕХ — сервисный менеджер, который автоматизирует всё, до чего дотянутся руки. Сегодня расскажу, как бот…

ботmaxsreitsmинцидентысистемное администрированиеcoreпараллельная рассылкаreply_fn
Habr
RU

Как мы внедряли SLO в платформу, которая отвечает за наблюдаемость в банке

Привет, Хабр! Я Руслан Боярский, SRE-инженер в Т-Банке, где мы строим и поддерживаем Sage — внутреннюю платформу наблюдаемости для 7 000+ инженеров.…

sreslosliдоступностьпродактobservabilitysageopenmetricsremotewriteпайплайн метрик
Habr
RU

Как стать SRE-инженером и сколько можно зарабатывать

Когда сервис падает на 20 минут в час пик, компания теряет репутацию и деньги — иногда десятки миллионов рублей. Поэтому SRE — одна из самых высокоо…

образование в итобразование в itsresre-инженерdevopsоблачные технологии
Habr
RU

От Prometheus к Victoria Metrics: как мы пересобрали мониторинг в Kubernetes

1.   Введение Всем привет! Меня зовут Яблоков Олег, я — ведущий инженер ИТ-отдела Navio и отвечаю за систему мониторинга основной инфраструктур…

victoriametricsprometheuskubernetesмониторингobservabilitysredevopsgitopsgrafanaalertmanager
Habr
RU

[Перевод] Логи, метрики и счёт в конце месяца: как телеметрия превращается в архитектурный долг

После инцидента команда почти всегда хочет видеть больше: добавить поле в лог, сохранить еще одну метку, оставить дашборд «на всякий случай». В моме…

observabilityтелеметриялогиOpenTelemetryметрикикардинальностьмониторингтрейсингsreархитектурный долг
Habr
RU

Где в IT джуны получают больше всего и куда пойти учиться

Зарплаты джунов в IT обычно невысокие. Работодатели ищут сотрудников с опытом от года даже на начальные позиции, а в вакансиях без опыта нередко пре…

образование в итобразование в itml-инженермашинное обучениеsre-инженерsreаналитика данных
Habr
RU

Когда метрики сходят с ума: автоматическая детекция аномалий во временных рядах в Yandex Monium

В инфраструктуре Яндекса работают тысячи микросервисов, которые каждую секунду генерируют миллионы временных рядов — метрик. Это могут быть количест…

яндексmachine learningалгоритмыаномалииsreobservability
Habr