надежность системы.

ИИ ускорил разработку. Почему продакшен стал ломаться чаще

В этой статье поговорим о том, почему команды, ускорившиеся с помощью искусственного интеллекта, продолжают ломать продакшен — и что иначе делают те, у кого такой проблемы нет.Начну с ситуации, которая, скорее всего, уже с вами случалась.На прошлой неделе вы сделали пулл-реквест. Код, сгенерированный искусственным интеллектом, выглядел аккуратно: читаемый diff, тесты проходят, ничего явно подозрительного. Вы его одобрили. А через два дня в продакшене что-то сломалось так, как никто не ожидал.Если с вами такого пока не было, вам просто повезло. Я вижу это постоянно, и у таких случаев есть общий паттерн.

продолжить чтение

Как мы научили ML группировать 50 000 событий в инциденты

Десятки, а иногда и сотни тысяч событий в день. Каждое — потенциальная авария, а может, просто шум. L1-инженеру нужно решить: добавить событие к инциденту? Создать новый? А может, это часть уже закрытого? Или всё серьёзнее — и перед нами экосистемный сбой, затрагивающий десятки сервисов?Раньше мы в МТС всё классифицировали вручную. Но при таком объёме и разнообразии инфраструктуры быстро поняли, что нужна автоматизация. Слишком велик риск пропустить важное, не найти корень проблемы, потратить драгоценные минуты в критический момент.

продолжить чтение