От справочника метаданных к инфраструктуре доверия: как изменился российский рынок Data Catalog за три года. Big Data.. Big Data. data catalog.. Big Data. data catalog. Data Engineering.. Big Data. data catalog. Data Engineering. data governance.. Big Data. data catalog. Data Engineering. data governance. базы данных.. Big Data. data catalog. Data Engineering. data governance. базы данных. Визуализация данных.. Big Data. data catalog. Data Engineering. data governance. базы данных. Визуализация данных. каталог данных.. Big Data. data catalog. Data Engineering. data governance. базы данных. Визуализация данных. каталог данных. управление данными.. Big Data. data catalog. Data Engineering. data governance. базы данных. Визуализация данных. каталог данных. управление данными. Хранение данных.
Data catalog

Data catalog

Главный сдвиг — Data Catalog перестал быть просто справочником метаданных и становится инфраструктурой доверия к данным и источником контекста для аналитиков, процессов и ИИ-агентов.

Три года назад мы выпустили исследование российских каталогов данных. Тогда для сравнения решений хватало около 20 вопросов: есть ли автоматическая каталогизация, Data Lineage, бизнес-глоссарий и другие базовые функции.

В отчёте «Data Catalog Круг Громова 2026» – количество критериев выросло до 325. За три года рынок заметно изменился, и прежней методики стало недостаточно. В этой статье расскажем не о результатах сравнения продуктов, а о главных изменениях рынка — в том числе тех, которых мы сами не ожидали увидеть.

2023 vs 2026: как изменилось исследование

Что сравниваем

Исследование 2023

Исследование 2026 — что усилили

Задача исследования

Обзор рынка и навигация по классу Data Catalog: российские, open-source и международные решения.

Фокус на практическом выборе российской платформы для корпоративного контура и проверке её промышленной применимости.

Периметр сравнения

5 российских продуктов плюс большой обзор open-source и международных каталогов.

7 российских платформ в основном сравнении; OpenMetadata — референсный профиль. Зарубежные коммерческие решения исключены из основного сравнения.

Методика

Около 20 укрупнённых характеристик: каталогизация, поиск, lineage, глоссарий, профилирование, ML и др.

325 критериев, 5 групп и 39 подгрупп. Вместо бинарного «есть / нет» оценивается глубина реализации функции.

Проверяемость

Основной формат — описательные профили и сводные таблицы характеристик.

Добавлена верификация множества источников: анкеты, документация, API, демонстрации/trial, экспертные сессии, кейсы и рыночные данные. Функциональность и подтвержденность оцениваются отдельно.

Глубина функционального анализа

Например, Data Lineage рассматривался в основном как наличие функции и уровень детализации.

Lineage разложен на механизмы: table/column-level, source-to-target mapping, impact analysis, автоматический захват из ETL/ELT, API/OpenLineage, редактирование и др.

Архитектура и эксплуатация

Фиксировались способ развёртывания, системные требования, лицензия и базовые интеграции.

Отдельно оцениваются масштабируемость, производительность, отказоустойчивость, резервное копирование, мониторинг, обновления, миграция, SLA и работа в закрытом контуре.

Российский контекст и ИБ

Импортозамещение было отдельным трендом; рынок российских решений ещё формировался.

Импортозамещение и локализация стали самостоятельной группой из 43 критериев: реестр ПО, сертификация, российские ОС/СУБД/BI, технологическая независимость, закрытые контуры и регуляторные требования.

ИИ и машинное обучение

ИИ/ML рассматривались как перспективный тренд; у российских каталогов ML почти не был представлен.

ИИ стал отдельной зоной сравнения: генерация описаний, интеллектуальный поиск, классификация чувствительных данных, AI-assisted governance, агенты и MCP. Разброс оценок: 23–94 из 100.

Практическая применимость

Главный результат — справочник по решениям и сводная сравнительная таблица.

Добавлены профили, тепловые карты и карта специализации «Круг Громова», рекомендации по пилоту и внедрению, разбор экономического эффекта и TCO. Сравнивается соответствие платформы сценарию заказчика, а не сумма функций.

 Главное изменение методики 2026 года: мы перестали сравнивать каталоги по принципу «функция есть или её нет» и стали проверять, насколько глубоко она реализована, подтверждена и пригодна для реальной корпоративной эксплуатации.

От справочника метаданных к инфраструктуре доверия: как изменился российский рынок Data Catalog за три года - 2

Крупнейшие игроки российского рынка Data Catalog 2026

Первое: список участников сменился наполовину

В отчёте 2023 года российские каталоги стояли в одном ряду с международными платформами и с открытыми проектами. Это было естественно: рынок только формировался, отечественных продуктов было пять, и сравнивать их имело смысл именно с тем, что заказчик мог купить или развернуть.

В исследовании 2026 года зарубежных платформ нет вообще. Единственный упомянутый неотечественный продукт – это OpenMetadata, и тот – в роли референсного профиля, потому что часть российских решений построена на его базе. Так сегодня выглядит рынок: в корпоративных закупках зарубежные каталоги перестали рассматриваться как опция.

Из пяти российских продуктов, которые мы разбирали в 2023-м, в сравнительный контур 2026 года вошли лишь три. Два ушли с рынка или сменили формат. Зато появились четыре новых участника, которых три года назад в такой список никто бы не поставил. То есть за три года состав обновился примерно наполовину. Для рынка, который принято считать сложившимся, это много.

Второе: оценка стала глубже

Самое интересное в старом отчёте сегодня не результаты, а список критериев. Тогда «есть ли Data Lineage» был осмысленным разделяющим вопросом: у части продуктов Data Lineage действительно не было. Сегодня он есть у всех семи, и разделяет уже не факт наличия, а глубина.

Поэтому в новом выпуске на один прежний признак приходится одиннадцать критериев. Это lineage на уровне таблиц, на уровне колонок, source-to-target mapping, анализ влияния изменений в обе стороны, автоматический захват из ETL-процессов, lineage через API и очереди сообщений, интерактивная графовая визуализация, ручное редактирование, версионирование. Один и тот же ответ «да» за этими критериями означает семь разных степеней готовности.

То же произошло с бизнес-глоссарием. Как справочник терминов он есть у всех, и оценки по этой подгруппе у всех участников высокие. А вот там, где нужна управляемость определения (workflow согласования, версии, история изменений, связь термина с правилом расчёта), картина расходится сильно. Разница между «есть глоссарий» и «глоссарием можно управлять» в 2023 году просто не имела способа проявиться в таблице.

Общий вывод, который мы для себя сделали, таков: старая методика перестала различать продукты, и переписывать её пришлось именно поэтому. Когда базовый контур закрыт у всех участников, инструмент сравнения обязан стать точнее, иначе он показывает семь одинаковых продуктов там, где их семь разных.

Третье и самое неожиданное – ИИ

Разрыв между замерами по этому параметру оказался самым сильным. В сравнительной таблице 2023 года признак, отвечавший за алгоритмы искусственного интеллекта и машинного обучения, не был проставлен ни одному из пяти российскому каталогу.

При этом тогда мы писали в разделе трендов:

«Эти возможности заявляются как сильные стороны продуктов, но на настоящий момент эти технологии находятся на раннем этапе: пользователи часто остаются не удовлетворёнными из-за большой остаточной ручной работы и не соответствующих ожиданиям результатов».

Сегодня этап формулировка верна наполовину. Разброс оценок по расширенным AI-возможностям в новом выпуске составил от 23 до 94 баллов из ста. Это самый широкий разброс во всём исследовании: ни в одной другой подгруппе продукты не расходятся так сильно. То есть маркетинговые обещания по-прежнему опережают реализацию, и проверять их надо на пилоте, а не по документации. Но у верхней части выборки за обещаниями уже стоит работающий функционал.

И появилось то, чего в 2023 году не было даже в виде вопроса. У одного из участников поверх каталога написан MCP-сервер, который открывает ИИ-агентам доступ к метаданным, техническим описаниям и скриптам расчёта. Работает он в контуре крупной компании, а не на демостенде. Три года назад мы спрашивали, умеет ли каталог сам автоматически расставлять метки. Сегодня осмысленный вопрос звучит иначе: может ли внешний агент получить из каталога контекст, достаточный, чтобы не выдумывать ответ.

Именно в этом, на наш взгляд, и состоит главное изменение класса продуктов за три года. Метаданные стали пригодны для машины, а не только для человека. Каталог перестал быть местом, куда ходит аналитик, и стал источником контекста для всего остального: для агентов, для пайплайнов и процессов согласования.

Что умеют каталоги данных в 2026 году?

Если суммировать без привязки к конкретным продуктам, за три года в классе появились и стали проверяемыми несколько ключевых параметров.

  • Промышленный column-level lineage и анализ влияния изменений в обе стороны: от источника к потребителям и от отчёта к исходным данным. В 2023-м это было свойством дорогих зарубежных платформ.

  • Классификация чувствительных данных с привязкой к регуляторным категориям, включая персональные данные по 152-ФЗ, с управляемым сроком действия маркировки.

  • Контроль качества данных внутри контура каталога, а не отдельной системой рядом: проверки, профилирование, инциденты качества, видимые прямо на объекте.

  • Ролевая модель, аудит действий и работа в закрытом контуре как условие допуска. Каталог хранит карту корпоративной архитектуры, и доступ к этой карте сам по себе стал предметом требований информационной безопасности.

  • Встроенность в платформенный стек: хранилища, озёра, ETL, BI, MDM, качество, управление доступом. Отдельно стоящий каталог сегодня почти не рассматривают.

За всем этим стоит измеримый эффект для заказчика: меньше времени на поиск данных, меньше конфликтующих версий отчётности, быстрее анализ последствий изменений, дешевле сопровождение сложного ландшафта.

От справочника метаданных к инфраструктуре доверия: как изменился российский рынок Data Catalog за три года - 3

Где проходит новая граница

А теперь честная часть, ради которой появилась эта статья.

Зрелый каталог отвечает на четыре вопроса: какие данные есть, где они лежат, кто ими владеет и как они связаны между собой. Этого достаточно, чтобы найти витрину и выйти на ответственного. Этого не хватает для ответа на пятый вопрос, который в корпоративной отчётности звучит чаще остальных: почему один и тот же показатель в двух отчётах даёт разные цифры.

Пример, который узнает любой, кто работал с корпоративной отчётностью. Финансы считают активным клиентом того, у кого была хотя бы одна оплата за квартал. Маркетинг относит к активным всех, кто заходил в личный кабинет за последние тридцать дней. Риски используют свой признак из скоринговой модели. Все три определения корректны внутри своего контура, все три опираются на согласованный глоссарий, и все три дают разные числа в отчёте на совете директоров.

Каталог покажет, что есть три витрины и у каждой свой владелец. На вопрос, какая цифра идёт в отчётность, он не ответит. И дело не в зрелости конкретных продуктов, а в природе класса. Каталог описывает то, что уже есть: собирает метаданные из источников и поддерживает актуальность этого отражения. Определения показателей никто не собирает из источников, их проектируют. У них другой жизненный цикл: согласование, утверждение, версия, дата вступления в силу, история изменений. И другой владелец: не владелец таблицы, а владелец методологии расчёта.

Отсюда вывод, который мы вынесли в отдельный раздел исследования. Требовать от каталога управления определениями показателей значит ставить задачу, для которой класс не предназначен, а потом читать закономерный результат как незрелость продукта. Инструмент задаёт форму, но ответственность за определения он не создаёт. Каталог за три года дошёл до этой границы и упёрся в неё. Дальше начинается зона, где работают уже не настройки платформы, а владельцы показателей и регламент изменений.

Как проверить это на себе

Проверка занимает недели, а не месяцы, и не требует полноценного внедрения. Возьмите пять-десять показателей, по которым в компании уже были расхождения, и пройдите по шагам.

  • Опишите их целиком: формула, зависимости, владелец, источники.

  • Измените формулу одного показателя, входящего в несколько витрин, и посмотрите, покажет ли система полный список затронутых объектов до применения изменения, а не после инцидента в отчётности.

  • Воспроизведите расчёт по состоянию на прошлый квартал и убедитесь, что версия определения восстанавливается однозначно.

  • Проведите полный цикл изменения силами бизнес-аналитика, без участия инженера данных, и зафиксируйте, где процесс упирается в разработку.

  • Проверьте обмен метаданными в обе стороны: попадают ли определения и связи в каталог и приходят ли обратно сведения о физических объектах, владельцах и статусах.

Результат этого мини-пилота обычно информативнее, чем сравнение функциональных таблиц двух вендоров.

Главные выводы исследования

  • За три года российский каталог данных перестал быть справочником таблиц и стал инфраструктурой доверия к данным.

Изменился не только список вопросов, которые стоит задавать вендорам, но и состав рынка. Появились возможности, которых в предыдущем замере не было даже в виде критерия.

  • При этом каталог не отменяет необходимости навести порядок в собственных процессах.

Он делает беспорядок видимым и управляемым, а это уже много: пока расхождения не видны, их не с чем сравнивать и некому исправлять. Выбирать платформу стоит по тому, насколько её профиль совпадает с устройством вашей организации, а длина списка функций тут мало что решает.

Полная версия исследования «Data Catalog Круг Громова 2026» доступна на russianbi.ru: методология, сравнительные профили, тепловые карты, карта специализации «Круг Громова», разбор экономики внедрения и отдельный раздел про слой определений показателей.

А теперь вопрос:

Сколько вариантов расчёта одного и того же показателя существует в вашей компании — и какой из них считается официальным? 😊

P.S. Чек-лист традиционно оставлю в комментарии.

Автор: GromovBI

Источник