Как я Zabbix с LLM дружил в свободное время. Архитектурный обзор взаимодействия с нейросетью. Часть 4 «Реализация»
У всех лапкиЭто заключительная статья цикла о том, как при четко поставленной задаче, заранее сформированном ТЗ, продуманном HLD и детальном LLD можно получить от нейросети не набор случайных скриптов, а вполне рабочий self-hosted сервис.
Когда ИИ мониторит ИИ: Полный стек наблюдаемости для LLM
пупупупуПредставьте: вы развернули в своём частном облаке или на локальных серверах Llama 3, DeepSeek или другую LLM. Данные остаются внутри инфраструктуры, модель работает локально, на первый взгляд система полностью здорова: CPU, память, сеть и сами сервисы работают без отклонений.
Релизь себя бережно, или Как применить к тревожности инженерное мышление
Несколько лет я выкатывала себя в продакшн каждый день: без сна, без команды, без логов и без плана отката. Каждое утро деплой на уставшую голову, а каждую ночь бесконечный воркер, который пережёвывает один и тот же сценарий катастрофы и жрёт всю память. И я была уверена, что так и надо: просто работа, просто период, просто характер такой, да и вообще у всех так.Но со временем поняла, что это не так, а теперь решила написать эту статью. Она про то, что когда мы выкатываем релиз в прод, то ведём себя как взрослые ответственные инженеры. А когда выкатываем в прод самих себя, то почему-то нет. А ещё про то, как это всё дело чинить.
Релизь себя бережно
Несколько лет я выкатывала себя в продакшн каждый день: без сна, без команды, без логов и без плана отката. Каждое утро деплой на уставшую голову, а каждую ночь бесконечный воркер, который пережёвывает один и тот же сценарий катастрофы и жрёт всю память. И я была уверена, что так и надо: просто работа, просто период, просто характер такой, да и вообще у всех так.Но со временем поняла, что это не так, а теперь решила написать эту статью. Она про то, что когда мы выкатываем релиз в прод, то ведём себя как взрослые ответственные инженеры. А когда выкатываем в прод самих себя, то почему-то нет. А ещё про то, как это всё дело чинить.
Представлено носимое устройство для мониторинга воздействия ультрафиолета
Компания The90 бывшего топ-менеджера Fitbit Стейси Салви представила носимое устройство The Gem. Оно позволяет отслеживать воздействие ультрафиолетового излучения.
Дело о молчаливой JVM: мониторинг Spring Boot с Prometheus и Grafana. Production-нуар
Она умерла в воскресенье вечером, и никто не услышал ни звука. Детективная история о том, как поставить прослушку на собственное приложение: Prometheus, Grafana, Micrometer, алерты, SLO. Все улики в комплекте, демо-проект прилагается. Совпадения с вашим продакшеном не случайны.Пролог. ТелоГород спал. Я - нет.Воскресенье, восемь вечера. Дождь стучал в окно, как healthcheck по мёртвому эндпоинту: методично и без надежды на ответ. На столе остывал ужин. Зазвонил телефон. Лёша, тимлид. Лёша по воскресеньям не звонит. По воскресеньям он отец, муж и человек. Если звонит, значит, человеком сегодня побыть не выйдет ни ему, ни мне.
SLA как инструмент, а не отчёт
Часть 2. Масштабирование, автоматизация, AI и два компонента надёжностиЭто вторая часть разбора того, как мы выстраивали SLA и инцидент-менеджмент в большом продукте.Меня зовут Дмитрий Химион, я руководитель ML Platform в X5 Digital. В первой части я рассказал, как мы пересобрали инцидент-менеджмент как процесс и внедрили единый алгоритм расчёта потерь, позволивший бизнесу и командам прийти к общему знаменателю.
От Prometheus к Victoria Metrics: как мы пересобрали мониторинг в Kubernetes
1. ВведениеВсем привет! Меня зовут Яблоков Олег, я — ведущий инженер ИТ-отдела Navio и отвечаю за систему мониторинга основной инфраструктуры компании. Это работа на стыке разработки и эксплуатации (development & operations, DevOps), наблюдаемости (Observability) и обеспечения надёжности сервисов (Site Reliability Engineering, SRE). Моя основная задача не просто собирать метрики, а сделать так, чтобы по ним можно было быстро понять статусы сервисов и не утонуть в шуме оповещений.

