От «грязных» справочников к золотым записям: как AI-ML спасает НСИ от хаоса. datareon.. datareon. Блог компании SOFROS.. datareon. Блог компании SOFROS. Интеграция.. datareon. Блог компании SOFROS. Интеграция. искусственный интеллект.. datareon. Блог компании SOFROS. Интеграция. искусственный интеллект. качество данных.

Введение

Представьте: вы открываете корпоративный справочник материалов и вместо стройной системы видите тысячи записей, которые называются по‑разному, но обозначают одно и то же. Где‑то написано «кабель ВВГ 3×2.5», где‑то — «ВВГнг 3×2,5», а где‑то просто «провод 3 жилы». И так по каждой позиции. Это не просто досадная мелочь, это прямые потери бюджета, сбои в закупках, поставках и невозможность собрать достоверную аналитику. А главное, с каждым годом данных становится только больше, а порядка в них — меньше.

Сегодня большинство компаний сталкиваются с серьезной проблемой: данные в локальных информационных системах постоянно деградируют, а традиционные подходы к очистке не дают необходимого эффекта. В результате организации вынуждены постоянно проводить дорогостоящие процессы дедупликации и нормализации, отвлекая ресурсы компании от основной деятельности.

Но ручная чистка — это бесконечный процесс, который съедает ресурсы и не даёт долгосрочного результата. Единственный устойчивый путь — автоматизация на основе искусственного интеллекта и машинного обучения. Гибридные модели, сочетающие классификацию, семантический поиск на базе языковых моделей и интеллектуальную экстракцию характеристик, позволяют не просто заменить человека за рутинной работой, но и делать процесс быстрее и точнее. Алгоритмы обучаются на реальных примерах, адаптируются под вашу номенклатуру и со временем превращаются в незаменимого помощника, который берёт на себя львиную долю задач по нормализации.

В этой статье, первой из цикла, мы разберём:

  • почему справочники неизбежно превращаются в хаос;

  • почему простые алгоритмы сравнения строк — это тупик;

  • что такое атрибутивная нормализация и из каких этапов она состоит;

  • как AI/ML меняет правила игры и какие задачи решает на каждом этапе.

Добро пожаловать в мир, где «грязные» данные превращаются в золотые записи, а хаос уступает место порядку.

Причины деградации нормативно‑справочной информации

Откуда берется хаос НСИ? Первая и наиболее распространенная причина — параллельное функционирование нескольких информационных систем, которые не взаимодействуют между собой. Когда отделы компании независимо друг от друга вводят одни и те же справочные единицы, неизбежно возникают дубли, так как каждый пользователь вносит данные по‑своему.

Различные подходы к внесению информации усугубляют эту проблему. Когда отделы компании используют разные методологии, одно и то же наименование НСИ неизбежно регистрируется в системах несколько раз. Также усугубляют ситуацию:

  • Организационные изменения — создание новых компаний, слияния и поглощения порождают новые информационные системы и, как следствие, множество дублей справочной информации.

  • Человеческий фактор играет немаловажную роль в деградации данных. Пользователи допускают опечатки, используют различные сокращения и вариации написания одного и того же наименования. Один сотрудник может записать «алюминиевый профиль», другой — «ал. Профиль», третий — «профиль алюм.», и в результате система содержит несколько идентичных элементов с разными написаниями.

  • Неполнота НСИ. На начальных этапах внедрения системы принимаются обоснованные решения о заполнении расширенного набора характеристик. Однако по мере развития проекта контроль качества неизбежно ослабевает, что приводит к частичному заполнению данных и потере полноты информации.

  • Устаревшие наименования и обозначения становятся проблемой, когда меняются ГОСТы и стандарты. Одни и те же элементы справочников могут быть заведены по‑разному в зависимости от версии стандарта. Кроме того, попытка точного соответствия спецификациям поставщиков создает дополнительные сложности, так как разные поставщики часто используют разные обозначения для одной и той же номенклатуры.

Почему простые алгоритмы сравнения строк — тупиковый путь

Многие компании пытались и продолжают пытаться решить проблему «в лоб» — сравнивать текстовые наименования, предполагая, что похожие строки означают одно и то же. 

Технически это выглядит просто: разбиваем строки на подпоследовательности или токены, считаем число совпадающих фрагментов, рассчитываем метрики похожести (расстояние Дамерау‑Левенштейна, Джаро‑Винклера, token‑ratio и тому подобное) и для каждой «сырой» записи выбираем эталон с максимальным значением метрики. На бумаге — красиво и просто: чем больше совпадений, тем выше вероятность, что это дубль. Но на практике такой подход дает большое количество ложноположительных и ложноотрицательных результатов. Также такой подход не учитывает цифровой шум (падежи, сокращения, опечатки и аббревиатуры), строки разной длины и строки с измененным порядком следования ключевых слов или даже символов (значение буквы зависит от её позиции в аббревиатуре. Например, буква «Г» в конце марки означает «голый» (без защитного покрова, как в ВВГ), а в начале — кабель для горных выработок).

Пример:

  • Пруток ПКРВХ 18,0 2000 БрАЖ9-4 МП ГОСТ 1628 — 2019

  • Пруток ПКВВХ 18,0 2000 БрАЖ9-4 МП ГОСТ 1628 — 2019

Позиции выглядят почти идентично для алгоритмов, отличие буквально в одной букве, но они описывают принципиально разные изделия: прутки круглой и квадратной формы сечения. Слияние таких записей приведет к ошибкам в спецификациях, неверной комплектации, срывам производства. Простые алгоритмы не учитывают особенности языка, такие как морфология, синтаксис и семантика. Это может привести к неправильному сравнению слов и фраз, особенно в языках с богатой грамматикой и сложной структурой.

Практика показывает, что метрики похожести дают приемлемое качество лишь в 30–40% случаев. Это слишком мало для автоматических объединений без проверки сотрудниками. Так как строки могут быть похожи формально, но различаться по ключевому атрибуту или наоборот, выглядеть совсем по‑разному, но означать один и тот же объект, например, несколько поставщиков указывали в своих спецификациях одно и то же изделие различными способами. Любая политика «берем эталон с максимальной метрикой» при таких условиях либо будет терять значимую долю совпадений (много ложноотрицательных), либо допускать опасные ложные слияния (много ложноположительных).

Единственно надежный путь — атрибутивная нормализация

Только после того, как система «понимает» структуру и смысл наименования, становится возможна корректная дедупликация и безопасное автоматическое объединение записей. Это обеспечивается извлечением и нормализацией атрибутов с выполнением контекстной семантической проверки.

Представьте, что справочная запись — это не просто название, а реальная карточка товара. За каждым словом скрываются десятки параметров: материал, форма, размеры, нормативные документы (ГОСТы, ТУ), технические особенности, варианты применения. Каждое из этих свойств важно — оно позволяет не просто отличить одну позицию номенклатуры от другой, но и корректно подобрать аналоги, проверить соответствие нормативам, интегрировать данные в технологический процесс. 

Процесс атрибутивной нормализации НСИ — это комплексная, многоэтапная процедура. Ее можно представить как последовательность из пяти крупных фаз, каждая из которых решает свои задачи и является фундаментом для следующей.

Фаза 1: Аудит, анализ и подготовка. Этот этап — «диагностика» текущего состояния данных. Без него любые дальнейшие действия будут хаотичными. На данном этапе выполняются такие задачи как сбор и консолидация данных, проводится всесторонний анализ, разрабатываются методологии, регламенты, шаблоны и порядок взаимодействия с НСИ для всех сотрудников.

Фаза 2: Структурирование и обогащение данных. На этом этапе «сырые» данные превращаются в структурированную информацию.

  • Классификация: Каждой позиции присваивается категория из разработанного классификатора. Это определяет, к какому классу объектов она относится и какой набор свойств для нее обязателен.

  • Структурирование и выделение атрибутов и характеристик: «Сырой» текст наименования или описания «разбирается» на отдельные, четко определенные характеристики (атрибуты). Например, из строки «Кабель ВВГнг 3×2.5» выделяются атрибуты: Тип = ВВГнг, Количество жил = 3, Сечение = 2.5.

  • Обогащение данных: Пропущенные или недостающие атрибуты добавляются из внешних надежных источников, например, государственных классификаторов, сайтов производителей.

Фаза 3: Очистка, нормализация и создание эталонов. Самый ответственный этап, на котором данные доводятся до идеального состояния.

  • Нормализация значений: Все атрибуты приводятся к единому, стандартизированному формату. Например, все единицы измерения записываются как шт., кг, м, а не штука, килограмм.

  • Шаблонизация (Формирование эталонных наименований): На основе нормализованных атрибутов по заранее утвержденному шаблону генерируется единое стандартное наименование позиции. Это обеспечивает единообразие и упрощает поиск.

  • Дедупликация и выявление аналогов: Автоматически находятся и объединяются дублирующие записи, а также выявляются аналоги. В результате для каждого реального объекта создается одна «золотая запись» (Golden Record) — эталон, содержащий всю полноту и достоверность информации.

Фаза 4: Публикация, интеграция и контроль. Финальный этап, на котором результаты нормализации «вводятся в эксплуатацию».

  • Валидация и контроль качества: На всех этапах, и особенно перед финалом, данные проверяются на соответствие правилам и бизнес‑логике. «Плохие» данные не попадают в систему.

  • Публикация и интеграция: Нормализованные и проверенные данные загружаются в целевые информационные системы (ERP, MDM, BI и др.).

  • Документирование: Все принятые решения, правила и изменения фиксируются для обеспечения прозрачности и возможности аудита.

Фаза 5: Сопровождение и постоянное улучшение. Нормализация — это не разовое событие, а непрерывный процесс. Этот этап важен для поддержания порядка в будущем.

  • Разработка регламентов ведения: Создаются четкие инструкции для сотрудников о том, как правильно создавать, изменять и вести записи в справочниках.

  • Сопровождение справочников: Осуществляется постоянный мониторинг качества, актуализация данных и разрешение спорных ситуаций.

  • Обучение персонала: Проводится обучение всех пользователей и экспертов НСИ работе по новым стандартам.

Весь этот многоэтапный путь направлен на создание единого, непротиворечивого источника достоверных данных, который становится прочным фундаментом для эффективного управления бизнесом. В современных подходах эти этапы часто объединяются в единый автоматизированный конвейер с использованием алгоритмов машинного обучения и LLM для ускорения и повышения качества обработки.

Примеры задач, решаемых с использованием сервиса SOFROS AI/ML

SOFROS AI/ML помогает компаниям перейти от разрозненной и трудоемкой работы с нормативно‑справочной информацией к управляемому, масштабируемому и интеллектуальному процессу повышения качества данных. Сервис автоматизирует ключевые операции с НСИ, снижает нагрузку на экспертов. повышает точность, полноту и сопоставимость корпоративных справочников.

Автоматическая классификация и категоризация

SOFROS AI/ML автоматически распределяет данные по заданным категориям: отраслям, регионам, типам организаций, группам продукции, классам материалов и другим признакам. Это ускоряет обработку больших массивов НСИ, снижает количество ручных операций и обеспечивает единый подход к классификации данных в рамках корпоративных стандартов.

Извлечение характеристик, шаблонизация и нормализация

Модели машинного обучения автоматически выделяют значимые характеристики из наименований, описаний и справочных записей, приводят их к единой структуре и формату. Сервис помогает стандартизировать разнородные записи, формировать шаблоны описаний, нормализовать значения и устранять неоднозначность в данных. Это особенно важно при работе с большими справочниками, где ручная обработка требует значительных ресурсов и не всегда обеспечивает стабильное качество.

Повышение качества и полноты данных

SOFROS AI/ML помогает системно улучшать качество НСИ, делая данные более точными, полными, структурированными и пригодными для дальнейшего использования в бизнес‑процессах. Для дообогащения характеристик могут использоваться как внутренние корпоративные источники, так и открытые данные из интернета. Это позволяет дополнять карточки объектов недостающими параметрами, уточнять описания и повышать ценность справочной информации для пользователей и смежных систем.

Валидация результатов нормализации

Сервис SOFROS AI/ML обеспечивает проверку качества нормализации на основе сформированных обучающих валидационных и тестовых датасетов и технологий повторной нормализации, включая такие подходы как агломеративная кластеризация, кросс‑валидация и Leave‑one‑out, семантическая валидация, а также построение матрицы ошибок (сonfusion matrix). В случае если система недостаточно уверена в полученных результатах, она может попросить дополнительно провалидировать их у эксперта.

Совокупность механизмов позволяет сравнивать результаты обработки с эталонными или ранее подтвержденными данными, выявлять отклонения и повышать доверие к результатам как автоматической, так и ручной нормализации.

Выявление и устранение дубликатов

Сервис SOFROS AI/ML помогает находить полные и неочевидные дубликаты в справочниках НСИ, включая записи с различиями в написании, структуре, порядке слов или наборе характеристик. Это позволяет сократить избыточность данных, повысить точность справочников и снизить риски ошибок в закупках, учете, аналитике и интеграционных процессах.

Контроль полноты и корректности выделения характеристик

Сервис SOFROS AI/ML сравнивает результаты выделения характеристик с эталонными данными, корпоративными правилами и отраслевыми стандартами. Он выявляет пропущенные параметры, проверяет корректность терминологии, контролирует соответствие заданным критериям и помогает исправлять ошибки. В результате компании получают более надежную и стандартизированную структуру НСИ.

Интеграция с корпоративными системами

SOFROS AI/ML может встраиваться в существующий ИТ‑ландшафт клиента и работать совместно с MDM‑системами, инструментами анализа данных, BI‑платформами и ERP‑решениями. Уже реализованы сценарии интеграции с BI‑системами и бесшовного взаимодействия с SAP‑ландшафтом. Это позволяет использовать возможности AI/ML непосредственно в привычных бизнес‑процессах без необходимости создавать отдельный изолированный контур обработки данных.

Результаты для бизнеса

В результате сервис SOFROS AI/ML становится не точечным инструментом для одной операции, а технологической платформой для комплексной работы с НСИ. Сервис поддерживает полный цикл повышения качества данных: от интеллектуального поиска, классификации и извлечения характеристик до нормализации, валидации, дообогащения и устранения дублей.

Архитектура решения позволяет гибко выбирать оптимальный сценарий под требования конкретного клиента. В случаях, где это допустимо и экономически оправдано, возможно подключение облачных моделей. В любом случае в рамках сервиса предусматривается возможность маскирования конфиденциальной информации. Например, в рамках соблюдения ФЗ 152 вся персонифицированная информация маскируется специальным PII классом перед отправкой в LLM. Для задач с повышенными требованиями к безопасности могут использоваться локальные языковые модели внутри защищенного контура без передачи данных во внешние сервисы. Такой подход обеспечивает конфиденциальность, снижает зависимость от внешних провайдеров и расхода токенов, а также позволяет применять AI/ML не как экспериментальную технологию, а как надежный практический инструмент для ежедневной работы с корпоративными данными.

Краткие выводы

  1. НСИ неизбежно деградирует — дубли, ошибки, неполнота и устаревшие записи возникают из‑за человеческого фактора, множества учётных систем и организационных изменений.

  2. Простые алгоритмы сравнения строк — тупик. Они дают приемлемое качество лишь в 30–40% случаев, не учитывают семантику, контекст и структуру объектов.

  3. Атрибутивная нормализация — единственное надёжное решение. Она превращает «плоское» наименование в набор чётких характеристик и проходит пять этапов: от аудита до постоянного сопровождения.

  4. AI/ML делает нормализацию масштабируемой. Гибридные модели автоматизируют классификацию, извлечение атрибутов, дедупликацию и валидацию, обучаясь на реальных данных.

  5. Сервис SOFROS AI/ML закрывает полный цикл — от интеллектуального поиска до интеграции с корпоративными системами, включая соблюдение требований безопасности.

Это была первая статья нашего цикла про сервис SOFROS AI/ML. Мы рассмотрели предпосылки его появления и методологию. В следующей статье мы более подробно рассмотрим архитектуру и реализацию отдельных инструментов, входящих в состав нашего сервиса.

Вы сталкивались с внедрением AI/ML в процессы работы с НСИ?

Если у вас есть опыт, успешный или не очень, расскажите, что было самым сложным?

  • Сбор и разметка данных?

  • Выбор и обучение моделей?

  • Интеграция с корпоративными системами?

  • Сопротивление пользователей?

Если вас заинтересовал наш сервис, вы можете записаться на бесплатную консультацию и демонстрацию.

Автор: stentor123

Источник