Всем привет!
Я порядка 15 лет занимаюсь администрированием СУБД, а в данный момент работаю на должности старшего инженера по базам данных.
За свою карьеру мне довелось попробовать в работе разные системы мониторинга СУБД, но больше всего мне нравился Spotlight for SQL Enterprise. Это, наверное, лучшая система мониторинга, с которой мне доводилось работать.
К сожалению, Quest Software ушел из РФ, и компании, которые вынуждены соблюдать санкционные режимы, больше не могут им пользоваться. В попытках найти близкие альтернативы я понял, что ничего похожего на рынке нет, и понял: вот она, ниша, в которой можно проявить себя и применить весь свой опыт! :=)
Так появился Lumen.
Сначала — об архитектуре.
Lumen имеет аналогичную архитектуру со Spotlight, есть Diagnostic Server который устанавливается на Windows host. В нем настраиваются подключения к целевому серверу. На целевой сервер ничего устанавливать не нужно, необходимо лишь наличие прав на стороне сервера.
Какие системы смотрим. Сейчас это SQL Server, PostgreSQL, Windows и сама служба мониторинга.
Набор данных закрывает обычный день DBA: сессии, блокировки, память, диски, бэкапы, HA, репликация. Linux и MySQL – coming soon.
За сбор данных отвечает Lumen Diagnostic Server (LDS) — служба на Windows.
Сборщиков сейчас 137, правил алертов из коробки — 100. Частота разная: сессии и блокировки каждые 30 секунд, список баз и файлы — раз в час.

Куда это складывается. Данные с SQL Server, Windows и PostgreSQL едут в одно место: Diagnostic Server снимает срез и пишет его в свои две базы.

Playback. Самая частая жалоба после инцидента звучит так: «час назад всё стояло, а сейчас уже нормально — покажи, что тогда было». В Lumen на это отвечает Playback.
Выбираете время — и все экраны покажут сервер на тот момент: сессии, блокировки, диски, алерты.
Playback позволяет проводить детальный postmortem инцидентов и видеть состояние всех метрик и активных сессий, запросов и планов сервера на момент проблемы.
Lumen Alert System. Уже встроена в Diagnostic Server и содержит 100 настраиваемых правил. Пользователь может задать свои пороги и условия или вернуть правило к заводским настройкам.

Карта дашбордов Lumen:
Теперь давайте посмотрим на основной функционал, он покажется привычным для пользователей Spotlight for SQL Enterprise. Слева мы видим список подключенный в мониторинг хостов, при выборе хоста мы увидим домашний экран с основными показателяим.
Основной Drilldown для анализа текущей активности SQL Activity:
Удобная область для работы даже с самыми большими планами:
Workload Analisys
Незаменимый инструмент экспресс анализа нагрузки
AI Оператор
Мне давно хотелось подружить ИИ агента и мониторинг, визуализируя, я представлял, как агент 24/7 следит за здоровьем вверенного ему хоста и сигнализирует, когда фиксирует проблему. Ровно так я реализовал эту идею в Lumen. Для каждого подключения создается Watcher (но мне нравится термин “Хранитель”, поэтому я буду в дальнейшем использовать его), хранитель использует локальную LLM модель llma 3.1, имеет свой “RAG” и набор инструментов. Когда хранитель фиксирует проблему, он сигнализирует агенту оркестратору (Supervisor), который приступает к первичному анализу. Supervisor ставит задачи хранителю, проверить дополнительные параметры, ждет результат, проводит анализ и сообщает человеку в чат.
Ниже я приведу полную архитектуру и покажу несколько примеров.
Как я говорил, хранитель имеет память и запоминает все значимые события на сервере. К нему можно обратиться напрямую в чате:
Так Supervisor реагирует на блокировку, как видно по тексту, он помнит, что такие блокировки уже были и совершенно точно опознал, что это тесты.
Хранитель отлично справляется с мониторингом и фиксирует проблему практически сразу
Реакция на заполнение tempDB:
Кажется я рассказал все, что хотел, если что-то забыл, обязательно расскажу об этом в новых статьях. Спасибо за внимание.
Автор: apatkin


