мониторинг.

Как проверить postmortem, подготовленный LLM. Разбираем инцидент Cloudflare

«Все сервисы восстановили в 14:30» выглядит как обычная строка хронологии. Но для инцидента Cloudflare, который мы разберём ниже, она неверна: к этому времени в значительной степени восстановился основной трафик, а полное восстановление наступило позже.Такое сокращение меняет оценку последствий сбоя. Команда рискует пропустить часть проблем и меры, которые помогли бы их устранить.Если вы поручаете большой языковой модели, LLM, подготовить postmortem, письменный разбор причин и последствий сбоя, результату нужна содержательная проверка. Разберём её на материале

продолжить чтение

Кредитный радар: LLM-воркфлоу, который каждое утро читает условия 12 банков и сам проверяет свои числа

TL;DR. Собрал воркфлоу на языковой модели, который раз в сутки обходит 34 страницы условий у 12 российских банков, сравнивает их со вчерашним снимком и публикует сводку изменений с ссылкой на источник в каждой строке, а при изменении цены пишет разбор с расчётом. Модель вызывается в четырёх точках и ни в одной не решает, что делать дальше. Цитаты, числа и статистика проверяются кодом. Каждый выпуск оценивается по 14 бинарным проверкам, метрики публичные. Стоит от 3 центов до 70 в день. Ниже устройство, проверки, evals и что он нашёл за первую неделю.

продолжить чтение

Бэкап, из которого ни разу не восстанавливались — это не бэкап

Привет, Хабр! У резервного копирования есть свойство, которое отличает его от почти всего остального в инфраструктуре. Проверить, работает ли оно, можно ровно одним способом — восстановиться. Всё остальное проверяет что‑то другое.Ситуация тем неприятнее, что узнаёте вы об этом в единственный день, когда копия понадобилась. Поэтому в статье рассмотрим пять мест, где схема резервного копирования разваливается. Ноль в конце формулыНачну с главного, потому что остальные пять — его частные случаи.Правило 3-2-1 знают все:

продолжить чтение

Google и НАСА представили ИИ‑модель MAPL‑EMIT для глобального поиска выбросов метана по спутниковым данным

Google и Лаборатория реактивного движения НАСА (JPL) представили модель искусственного интеллекта MAPL‑EMIT, которая отслеживает глобальные выбросы метана по всему миру, используя спутниковые данные. Данные для модели поставляет детектор Earth Surface Mineral Dust Source Investigation (EMIT), установленный на борту МКС.

продолжить чтение

200 OK от гейтвея ничего не значит

Обычная HTTP-проверка может показывать, что ИИ-сервис работает, хотя его пользователи уже не получают ответы. Эндпоинт доступен, гейтвей на месте, но до самой модели проверка не доходит.Привет, Хабр! Меня зовут Михаил Шпаков, я развиваю Statuser — сервис мониторинга доступности сайтов. Раньше я рассказывал, как он появился и что я узнал за год, мониторя 6 500 сайтов.

продолжить чтение

Lumen: попытка воссоздать лучшие практики мониторинга СУБД

Консоль системы мониторинга СУБД LumenВсем привет! Я порядка 15 лет занимаюсь администрированием СУБД, а в данный момент работаю на должности старшего инженера по базам данных.

продолжить чтение

GEO своими руками: собираем трекинг видимости бренда в ИИ‑ответах на n8n [+ воркфлоу]

И у Google (AI Overviews), и у Яндекса генеративный ответ стоит над обычной выдачей. Человек ищет как раньше, но первое, что он видит — не десять ссылок, а готовую рекомендацию с двумя‑тремя брендами. Можно быть топ-1 по всем целевым запросам и не попасть в этот блок ни разу.Дисциплина, которая с этим работает, называется GEO (Generative Engine Optimization). Статья про две вещи: что в ИИ‑ответе реально поддаётся измерению и как я собрал под это воркфлоу на n8n. Ссылка на GitHub в конце статьи.

продолжить чтение

Все компоненты зелёные, а продакшн лежит: разбор аварии, которую нашли в git

Инфраструктура была покрыта кодом почти на сто процентов. Мониторингом покрыты все компоненты. В момент аварии все метрики базы данных были идеальными, соседние сервисы на том же сервере СУБД работали без единой ошибки, провайдер облака показывал зелёный статус.При этом продакшн лежал двадцать минут, и первые пятнадцать никто не понимал, что происходит.Причина лежала в истории изменений инфраструктуры, и за первые пятнадцать минут туда не посмотрел никто.Дисклеймер про обезличивание

продолжить чтение

Как научить ИИ разгребать метрики, пока дежурный допивает чай

Конспект доклада про ИИ-агента для разбора инцидентов с первого занятия «Вечерней школы. ИИ для инженеров: польза и риски» от Слёрма

продолжить чтение

Как внедряется ИИ на стройке: особенности масштабирования, данных и обучения моделей под российские реалии

Процесс внедрения ИИ на стройке имеет свою специфику. Дело в том, что здесь есть свои подводные камни при масштабировании обработки видеопотоков, при самом процессе обработки данных и при дополнительном обучении модели YOLO под наши российские реалии. Расскажу обо всём по порядку. Как происходит масштабирование обработки видеопотоков с 5 до 500 камер

продолжить чтение

123456...7