Вместо введения. Коротко о главном из первой части
Это вторая статья из цикла публикаций про наш сервис Sofros AI/ML. С первой статьёй вы можете ознакомиться по данной ссылке.
В прошлый раз мы разобрались, почему нормативно-справочная информация (НСИ) неизбежно деградирует в любой растущей компании:
-
параллельное ведение данных в нескольких системах;
-
человеческий фактор – опечатки, сокращения, вариации написания;
-
организационные изменения и неполнота атрибутов;
-
устаревшие стандарты и попытки подогнать справочник под каждого поставщика.
Мы также показали, почему классические алгоритмы сравнения строк (Левенштейн, Джаро‑Винклера, token‑ratio) – это тупик. Они дают приемлемое качество лишь в 30-40% случаев, не учитывают морфологию, контекст и семантику. А главное – не видят структуру объекта за текстовой строкой.
В первой части мы описали методологию атрибутивной нормализации и в качестве практического примера рассмотрели сервис SOFROS AI/ML, который автоматизирует полный цикл: от извлечения характеристик до валидации и устранения дубликатов.
Но методология – это полдела. Главный вопрос, который остался за кадром: как именно устроен сервис «под капотом»?
Во второй статье мы заглянем внутрь SOFROS AI/ML:
-
какая архитектура лежит в основе сервиса;
-
какие модели машинного обучения и LLM используются, и за что отвечает каждая;
-
как сервис интегрируется с 1С:MDM, SAP и другими системами через REST API;
-
как мы обеспечиваем безопасность и соблюдение требований ФЗ‑152.
Переходим к деталям.
Сервис SOFROS AI/ML: открытое API для работы с моделями машинного обучения
В ходе реализации проектов по нормализации НСИ эксперты SOFROS пришли к выводу: ни один инструмент не решает задачу самостоятельно.
В одних случаях эффективны шаблонные методы – они позволяют быстро выделять нормативы и стандартные параметры. В других – классическое машинное обучение. А для наиболее сложных формулировок, где важны контекст и семантика, применимы современные языковые модели (LLM). Они требуют больших вычислительных ресурсов, но обеспечивают высокое качество даже на неструктурированных описаниях.
Именно поэтому в сервисе SOFROS AI/ML применяется гибкое сочетание всех трёх подходов. Гибридный метод позволяет одновременно обрабатывать большие массивы записей с высокой точностью.
На основе структурированных данных решаются прикладные задачи:
-
поиск дублей;
-
подбор аналогов;
-
сопоставление со справочниками филиалов;
-
интеграция в технологические процессы.
Функциональные компоненты сервиса Sofros AI/ML
Архитектура сервиса включает четыре ключевых уровня. Разберём каждый.
1. Ядро сервиса
Ядро управляет всеми AI/ML-процессами, формирует SDK для работы с моделями и предоставляет интерфейс для взаимодействия с пользователями.
Оно состоит из:
-
автономного сервера взаимодействия – разработан на микросервисной архитектуре, поддерживает Windows и Linux. Взаимодействие с внешними системами – через REST API. Для тестирования предоставляется интерфейс Swagger (интерактивная документация API).
-
менеджеров сервисов – обеспечивают добавление моделей, их обучение, пополнение обучающих примеров и выполнение прогнозирования.
Также в составе ядра присутствует расширение для 1С:MDM Управление нормативно-справочной информацией, редакция 2.5. Оно реализует бизнес-логику нормализации, формирует SDK для взаимодействия с библиотеками AI от 1С и API для связи с автономным сервером.
Важно: в данный момент мы разрабатываем автономный клиент для интеграций с различными системами и сервисами. О нём и о методологии Spec-Driven Development (SDD) мы расскажем в одной из следующих статей цикла.
2. Модели AI/ML
Модели – это классы, содержащие методы для обучения, предсказания и оценки качества. Скрипты реализованы на Python.
В составе сервиса присутствуют следующие модели:
|
Модель |
Какие задачи решает |
|---|---|
|
Модель классификации |
Наивный байесовский классификатор определяет категорию объекта (например, «кабель», «насос», «крепёж»). |
|
Модель экстракции |
Извлечение именованных сущностей (NER) выделяет из текста атрибуты – тип, сечение, материал, ГОСТ. |
|
Модель семантического поиска |
Генерация с дополнительной выборкой находит семантически похожие записи. Применяется для задач нечёткого поиска и сопоставления. Например, можно сопоставить две характеристики: “сечение жилы” и “сечения токопроводящих жил” для модели семантического поиска будут являться одинаковыми характеристиками. |
|
Модель контекстного поиска |
Вызов инструментов веб-поиска обогащает данные из внешних источников. Также модель контекстного поиска может использоваться для поиска новых видов характеристик. |
|
PII-класс |
Выделение персонально идентифицируемой информации (Personal Identifiable Information) для маскирования перед отправкой в LLM. |
Подробнее об архитектуре и реализации каждой модели мы расскажем в следующих частях цикла.
3. Дополнительные модели и сервисы (доступны по запросу)
|
Модель или сервис |
Какие задачи решает |
|---|---|
|
MCP-сервер для 1С:MDM |
Предоставляет инструменты для доступа к SDK моделей SOFROS AI/ML, данным и метаданным 1С:МДМ. |
|
AI-модель NER на базе LLM GLiNER |
Улучшенное выделение специфических типов НСИ. Работает zero-shot (без дообучения) или few-shot (с минимальным обучением). Встраивается в пайплайн ML-моделей. |
|
Модель агломеративной кластеризации |
Структурирует неразмеченные данные. Помогает создавать признаки для разметки, решать задачи сегментации, обнаруживать выбросы и аномалии, очищать и структурировать данные (используется для подготовки обучающих датасетов, помогает находить минимально необходимые примеры для обучения других моделей). |
4. Инфраструктурный уровень
-
Провайдеры локальных и облачных LLM – вычислительные узлы (GPU-кластеры) для развертывания больших языковых моделей внутри периметра заказчика (опционально).
-
Библиотеки машинного обучения (ML) – готовые наборы инструментов, функций и алгоритмов, а также среда исполнения.
Как это работает в связке с MDM
В контексте MDM-системы (Master Data Management) интеллектуальный сервис встраивается в существующий контур и автоматически обрабатывает все входящие данные.
Для сотрудников процесс остаётся привычным: они работают в основной системе. Но каждая запись теперь проходит интеллектуальную обработку:
-
приводится к единому корпоративному формату;
-
извлекаются и нормализуются атрибуты;
-
значения проверяются по справочным данным;
-
выполняется валидация и контроль логических связей.
В итоге в MDM поступает корректная запись, которую эксперт только утверждает. Далее она становится доступной для всех взаимосвязанных систем, использующих единый номенклатурный справочник.
Важно подчеркнуть: SOFROS AI/ML не заменяет MDM-систему, а расширяет её возможности, снимая рутинную нагрузку с экспертов и автоматизируя нормализацию, проверку и структурирование данных.
Краткие выводы
-
SOFROS AI/ML построен на гибридном подходе: шаблоны + классические ML-модели + LLM. Каждый инструмент решает свой класс задач.
-
Ядро сервиса – это микросервисная архитектура с REST API, которая интегрируется с 1С:MDM, SAP и другими системами.
-
В составе сервиса – модели для классификации, экстракции атрибутов, семантического и контекстного поиска, а также PII-маскировки.
-
Сервис может работать как с облачными LLM, так и с локальными моделями внутри защищённого контура заказчика.
-
Главная ценность – автоматизация полного цикла: от входящей «сырой» записи до эталонной «золотой записи».
Почему использовать сервис SOFROS AI/ML – это выгодно?
-
Сокращение ручного труда экспертов НСИ на 70-80%.
-
Снижение ошибок при закупках, комплектации и планировании.
-
Единый стандарт данных во всех филиалах и системах.
-
Работа с конфиденциальными данными без рисков благодаря локальным LLM и PII-маскировке.
Что дальше?
В следующей части цикла мы подробно рассмотрим архитектуру и реализацию моделей машинного обучения и искусственного интеллекта: как они обучаются, как оценивается их качество и как они встраиваются в общий пайплайн.
А пока задавайте вопросы в комментариях. Какая тема вам интереснее всего?
Если вас заинтересовал наш сервис, вы можете записаться на бесплатную консультацию и демонстрацию.
Автор: stentor123


