Prometheus.

Два года, один человек, 66 контейнеров: как я построил AI‑платформу на железе под столом

продолжить чтение

ИИ в эксплуатации (AIOps): разбор алертов и автоматизация инцидентов

В марте 2025 года аналитическое агентство Gartner сделало то, чего индустрия ждала несколько лет: официально переименовало рыночную категорию AIOps в Event Intelligence Solutions — решения для интеллектуальной обработки событий. Причиной стал ИИ-хайп, из-за которого слово «AIOps» превратилось в бессмыслицу. Вендоры называли искусственным интеллектом всё, от простейших регулярных выражений до тяжёлых LLM, обещающих полную автономию эксплуатации. В итоге ИТ-директора разочаровались, а инженеры получили очередной слой непредсказуемой автоматики.

продолжить чтение

Куда пропали 14 млрд рынка observability?

Привет, Хабр!

продолжить чтение

Как настроить глубокий и понятный мониторинг для PostgreSQL с ИИ на основе Prometheus, TaskTracker и Pipeliner

продолжить чтение

Джефф Безос: ИИ создаст дефицит рабочей силы. Тем временем Amazon сократил 30 тыс сотрудников

продолжить чтение

ИИ-стартап Джеффа Безоса стремится создать «искусственного инженера-универсала»

Основатель Amazon Джефф Безос заявил, что его новый стартап в области ИИ Prometheus будет работать над созданием «искусственного инженера-универсала». Он стремится разработать инженерные инструменты на основе ИИ для помощи в проектировании физических продуктов.

продолжить чтение

Дело о молчаливой JVM: мониторинг Spring Boot с Prometheus и Grafana. Production-нуар

Она умерла в воскресенье вечером, и никто не услышал ни звука. Детективная история о том, как поставить прослушку на собственное приложение: Prometheus, Grafana, Micrometer, алерты, SLO. Все улики в комплекте, демо-проект прилагается. Совпадения с вашим продакшеном не случайны.Пролог. ТелоГород спал. Я - нет.Воскресенье, восемь вечера. Дождь стучал в окно, как healthcheck по мёртвому эндпоинту: методично и без надежды на ответ. На столе остывал ужин. Зазвонил телефон. Лёша, тимлид. Лёша по воскресеньям не звонит. По воскресеньям он отец, муж и человек. Если звонит, значит, человеком сегодня побыть не выйдет ни ему, ни мне.

продолжить чтение

От Prometheus к Victoria Metrics: как мы пересобрали мониторинг в Kubernetes

1.   ВведениеВсем привет! Меня зовут Яблоков Олег, я — ведущий инженер ИТ-отдела Navio и отвечаю за систему мониторинга основной инфраструктуры компании. Это работа на стыке разработки и эксплуатации (development & operations, DevOps), наблюдаемости (Observability) и обеспечения надёжности сервисов (Site Reliability Engineering, SRE). Моя основная задача не просто собирать метрики, а сделать так, чтобы по ним можно было быстро понять статусы сервисов и не утонуть в шуме оповещений.

продолжить чтение

Model Predictive Control для Kubernetes autoscaling: что получилось, где HPA оказался сильнее

Горизонтальное автоскалирование в Kubernetes обычно начинается с HPA. Это понятный и практичный механизм: контроллер смотрит на метрику, например CPU, и меняет число реплик Deployment. Для многих сервисов этого достаточно.Проблема начинается там, где нагрузка меняется быстрее, чем контур успевает на неё отреагировать. Метрика должна быть собрана, решение должно быть принято, новые Pod’ы должны запуститься и пройти readiness. Пока всё это происходит, старые Pod’ы уже могут работать на пределе, а хвостовые задержки p95/p99 — расти.

продолжить чтение

Зачем нужны APM-платформы, если есть Prometheus и Grafana

Всем привет! Меня зовут Дмитрий, я архитектор продукта и занимаюсь развитием APM-платформы.

продолжить чтение

12