SRE.

SRE.

Как проверить postmortem, подготовленный LLM. Разбираем инцидент Cloudflare

«Все сервисы восстановили в 14:30» выглядит как обычная строка хронологии. Но для инцидента Cloudflare, который мы разберём ниже, она неверна: к этому времени в значительной степени восстановился основной трафик, а полное восстановление наступило позже.Такое сокращение меняет оценку последствий сбоя. Команда рискует пропустить часть проблем и меры, которые помогли бы их устранить.Если вы поручаете большой языковой модели, LLM, подготовить postmortem, письменный разбор причин и последствий сбоя, результату нужна содержательная проверка. Разберём её на материале

продолжить чтение

350 коммитов в неделю: как контрибьютить в проект, который меняется быстрее, чем ты пишешь

продолжить чтение

ИИ в эксплуатации (AIOps): разбор алертов и автоматизация инцидентов

В марте 2025 года аналитическое агентство Gartner сделало то, чего индустрия ждала несколько лет: официально переименовало рыночную категорию AIOps в Event Intelligence Solutions — решения для интеллектуальной обработки событий. Причиной стал ИИ-хайп, из-за которого слово «AIOps» превратилось в бессмыслицу. Вендоры называли искусственным интеллектом всё, от простейших регулярных выражений до тяжёлых LLM, обещающих полную автономию эксплуатации. В итоге ИТ-директора разочаровались, а инженеры получили очередной слой непредсказуемой автоматики.

продолжить чтение

502 на ingress, 302 в приложении: как я учил инфраструктурного LLM-агента не врать

Сначала контекст. Я делаю внутреннего read-only агента для инфраструктурных расследований: он может читать данные, но не изменять production. Инженер пишет ему в Mattermost или резервном web-чате обычный вопрос: «почему сервис отдаёт 502?», «кто выкатил эту версию?» или «что изменилось перед инцидентом?». Агент сам собирает данные из Kubernetes, VictoriaMetrics, Elasticsearch, GitLab, Grafana, GSLB и других эксплуатационных источников, а затем возвращает ответ с доказательствами и явно перечисленными пробелами.

продолжить чтение

Когда AOL перестал работать (1996)

Представьте, что вы перенеслись в 7 августа 1996 года. Закройте глаза и вообразите мир, где напряжённость в отношениях с Россией, Китаем и Ближним Востоком высока, люди обеспокоены технологическим пузырём, а брюки-клёш снова в моде. Трудно представить, я знаю.

продолжить чтение

Как я сделал локальный RAG-сервис для SRE: ищем по документации, ранбукам и коду через Ollama

Недавно я делал учебный проект про автоматизацию документирования инцидентов. Поначалу планы были грандиозными: инциденты, таймлайны, интеграции с мониторингами, чатами, постмортемы, подсказки дежурным инженерам.Но довольно быстро стало понятно, что с временными и ресурсными ограничениями лучше не пытаться написать маленький PagerDuty. Поэтому я сузил задачу до более реалистичного ядра: локального RAG-сервиса, который ищет по документации, ранбукам и коду, а затем передаёт найденный контекст в LLM.Так появился llmortem — FastAPI-сервис, который можно подключить к OpenWebUI как OpenAI-compatible backend.

продолжить чтение

От Prometheus к Victoria Metrics: как мы пересобрали мониторинг в Kubernetes

1.   ВведениеВсем привет! Меня зовут Яблоков Олег, я — ведущий инженер ИТ-отдела Navio и отвечаю за систему мониторинга основной инфраструктуры компании. Это работа на стыке разработки и эксплуатации (development & operations, DevOps), наблюдаемости (Observability) и обеспечения надёжности сервисов (Site Reliability Engineering, SRE). Моя основная задача не просто собирать метрики, а сделать так, чтобы по ним можно было быстро понять статусы сервисов и не утонуть в шуме оповещений.

продолжить чтение

62 бесплатных урока июня: Java, Docker, LLM, SRE, DWH и другие темы для роста в IT

Привет, хабровчане. В июньском дайджесте собрали 62 бесплатных открытых урока по ключевым IT‑направлениям: разработке, архитектуре, инфраструктуре, информационной безопасности, тестированию, ML, аналитике и управлению. В программе — Java 21, Docker, Kubernetes, LLM, Kafka, SRE, DWH, Data Mesh, REST API, Linux, DevOps и другие темы, которые сейчас регулярно всплывают в реальных проектах и технических обсуждениях.

продолжить чтение

Строим первую линию техподдержки на n8n за 250$ в месяц. Часть 2

В первой части

продолжить чтение

Когда метрики сходят с ума: автоматическая детекция аномалий во временных рядах в Yandex Monium

продолжить чтение

123