Как проверить postmortem, подготовленный LLM. Разбираем инцидент Cloudflare
«Все сервисы восстановили в 14:30» выглядит как обычная строка хронологии. Но для инцидента Cloudflare, который мы разберём ниже, она неверна: к этому времени в значительной степени восстановился основной трафик, а полное восстановление наступило позже.Такое сокращение меняет оценку последствий сбоя. Команда рискует пропустить часть проблем и меры, которые помогли бы их устранить.Если вы поручаете большой языковой модели, LLM, подготовить postmortem, письменный разбор причин и последствий сбоя, результату нужна содержательная проверка. Разберём её на материале
Кредитный радар: LLM-воркфлоу, который каждое утро читает условия 12 банков и сам проверяет свои числа
TL;DR. Собрал воркфлоу на языковой модели, который раз в сутки обходит 34 страницы условий у 12 российских банков, сравнивает их со вчерашним снимком и публикует сводку изменений с ссылкой на источник в каждой строке, а при изменении цены пишет разбор с расчётом. Модель вызывается в четырёх точках и ни в одной не решает, что делать дальше. Цитаты, числа и статистика проверяются кодом. Каждый выпуск оценивается по 14 бинарным проверкам, метрики публичные. Стоит от 3 центов до 70 в день. Ниже устройство, проверки, evals и что он нашёл за первую неделю.
Бэкап, из которого ни разу не восстанавливались — это не бэкап
Привет, Хабр! У резервного копирования есть свойство, которое отличает его от почти всего остального в инфраструктуре. Проверить, работает ли оно, можно ровно одним способом — восстановиться. Всё остальное проверяет что‑то другое.Ситуация тем неприятнее, что узнаёте вы об этом в единственный день, когда копия понадобилась. Поэтому в статье рассмотрим пять мест, где схема резервного копирования разваливается. Ноль в конце формулыНачну с главного, потому что остальные пять — его частные случаи.Правило 3-2-1 знают все:
200 OK от гейтвея ничего не значит
Обычная HTTP-проверка может показывать, что ИИ-сервис работает, хотя его пользователи уже не получают ответы. Эндпоинт доступен, гейтвей на месте, но до самой модели проверка не доходит.Привет, Хабр! Меня зовут Михаил Шпаков, я развиваю Statuser — сервис мониторинга доступности сайтов. Раньше я рассказывал, как он появился и что я узнал за год, мониторя 6 500 сайтов.
Lumen: попытка воссоздать лучшие практики мониторинга СУБД
Консоль системы мониторинга СУБД LumenВсем привет! Я порядка 15 лет занимаюсь администрированием СУБД, а в данный момент работаю на должности старшего инженера по базам данных.
GEO своими руками: собираем трекинг видимости бренда в ИИ‑ответах на n8n [+ воркфлоу]
И у Google (AI Overviews), и у Яндекса генеративный ответ стоит над обычной выдачей. Человек ищет как раньше, но первое, что он видит — не десять ссылок, а готовую рекомендацию с двумя‑тремя брендами. Можно быть топ-1 по всем целевым запросам и не попасть в этот блок ни разу.Дисциплина, которая с этим работает, называется GEO (Generative Engine Optimization). Статья про две вещи: что в ИИ‑ответе реально поддаётся измерению и как я собрал под это воркфлоу на n8n. Ссылка на GitHub в конце статьи.
Все компоненты зелёные, а продакшн лежит: разбор аварии, которую нашли в git
Инфраструктура была покрыта кодом почти на сто процентов. Мониторингом покрыты все компоненты. В момент аварии все метрики базы данных были идеальными, соседние сервисы на том же сервере СУБД работали без единой ошибки, провайдер облака показывал зелёный статус.При этом продакшн лежал двадцать минут, и первые пятнадцать никто не понимал, что происходит.Причина лежала в истории изменений инфраструктуры, и за первые пятнадцать минут туда не посмотрел никто.Дисклеймер про обезличивание
Как научить ИИ разгребать метрики, пока дежурный допивает чай
Конспект доклада про ИИ-агента для разбора инцидентов с первого занятия «Вечерней школы. ИИ для инженеров: польза и риски» от Слёрма
Как внедряется ИИ на стройке: особенности масштабирования, данных и обучения моделей под российские реалии
Процесс внедрения ИИ на стройке имеет свою специфику. Дело в том, что здесь есть свои подводные камни при масштабировании обработки видеопотоков, при самом процессе обработки данных и при дополнительном обучении модели YOLO под наши российские реалии. Расскажу обо всём по порядку. Как происходит масштабирование обработки видеопотоков с 5 до 500 камер

