alertmanager.

Как научить ИИ разгребать метрики, пока дежурный допивает чай

Конспект доклада про ИИ-агента для разбора инцидентов с первого занятия «Вечерней школы. ИИ для инженеров: польза и риски» от Слёрма

продолжить чтение

Как мы внедрили AIOps для контроля GPU‑утилизации и повысили её на 60%

Привет, Хабр! На связи Даниил Понизов и Роман Лазовский, руководитель и MLOps‑инженер команды ML‑платформы в RWB. Мы занимаемся разработкой платформы машинного обучения, в том числе — контролируем инфраструктуру и эффективное использование ресурсов.Недавно проходил Inside AI Meetup, где мы рассказали про внедрение AIOps практик в нашей команде — видеозапись вы найдете тут.

продолжить чтение

ИИ в эксплуатации (AIOps): разбор алертов и автоматизация инцидентов

В марте 2025 года аналитическое агентство Gartner сделало то, чего индустрия ждала несколько лет: официально переименовало рыночную категорию AIOps в Event Intelligence Solutions — решения для интеллектуальной обработки событий. Причиной стал ИИ-хайп, из-за которого слово «AIOps» превратилось в бессмыслицу. Вендоры называли искусственным интеллектом всё, от простейших регулярных выражений до тяжёлых LLM, обещающих полную автономию эксплуатации. В итоге ИТ-директора разочаровались, а инженеры получили очередной слой непредсказуемой автоматики.

продолжить чтение

Дело о молчаливой JVM: мониторинг Spring Boot с Prometheus и Grafana. Production-нуар

Она умерла в воскресенье вечером, и никто не услышал ни звука. Детективная история о том, как поставить прослушку на собственное приложение: Prometheus, Grafana, Micrometer, алерты, SLO. Все улики в комплекте, демо-проект прилагается. Совпадения с вашим продакшеном не случайны.Пролог. ТелоГород спал. Я - нет.Воскресенье, восемь вечера. Дождь стучал в окно, как healthcheck по мёртвому эндпоинту: методично и без надежды на ответ. На столе остывал ужин. Зазвонил телефон. Лёша, тимлид. Лёша по воскресеньям не звонит. По воскресеньям он отец, муж и человек. Если звонит, значит, человеком сегодня побыть не выйдет ни ему, ни мне.

продолжить чтение

От Prometheus к Victoria Metrics: как мы пересобрали мониторинг в Kubernetes

1.   ВведениеВсем привет! Меня зовут Яблоков Олег, я — ведущий инженер ИТ-отдела Navio и отвечаю за систему мониторинга основной инфраструктуры компании. Это работа на стыке разработки и эксплуатации (development & operations, DevOps), наблюдаемости (Observability) и обеспечения надёжности сервисов (Site Reliability Engineering, SRE). Моя основная задача не просто собирать метрики, а сделать так, чтобы по ним можно было быстро понять статусы сервисов и не утонуть в шуме оповещений.

продолжить чтение