Как устроен наш сервис SOFROS AI-ML: гибридные модели и REST API для нормализации. Блог компании SOFROS.. Блог компании SOFROS. Интеграция.. Блог компании SOFROS. Интеграция. искусственный интеллект.. Блог компании SOFROS. Интеграция. искусственный интеллект. искуственный интеллект.. Блог компании SOFROS. Интеграция. искусственный интеллект. искуственный интеллект. машинное+обучение.. Блог компании SOFROS. Интеграция. искусственный интеллект. искуственный интеллект. машинное+обучение. софрос.

Вместо введения. Коротко о главном из первой части

Это вторая статья из цикла публикаций про наш сервис Sofros AI/ML. С первой статьёй вы можете ознакомиться по данной ссылке.

В прошлый раз мы разобрались, почему нормативно-справочная информация (НСИ) неизбежно деградирует в любой растущей компании:

  • параллельное ведение данных в нескольких системах;

  • человеческий фактор – опечатки, сокращения, вариации написания;

  • организационные изменения и неполнота атрибутов;

  • устаревшие стандарты и попытки подогнать справочник под каждого поставщика.

Мы также показали, почему классические алгоритмы сравнения строк (Левенштейн, Джаро‑Винклера, token‑ratio) – это тупик. Они дают приемлемое качество лишь в 30-40% случаев, не учитывают морфологию, контекст и семантику. А главное – не видят структуру объекта за текстовой строкой.

В первой части мы описали методологию атрибутивной нормализации и в качестве практического примера рассмотрели сервис SOFROS AI/ML, который автоматизирует полный цикл: от извлечения характеристик до валидации и устранения дубликатов.

Но методология – это полдела. Главный вопрос, который остался за кадром: как именно устроен сервис «под капотом»?

Во второй статье мы заглянем внутрь SOFROS AI/ML:

  • какая архитектура лежит в основе сервиса;

  • какие модели машинного обучения и LLM используются, и за что отвечает каждая;

  • как сервис интегрируется с 1С:MDM, SAP и другими системами через REST API;

  • как мы обеспечиваем безопасность и соблюдение требований ФЗ‑152.

Переходим к деталям.

Сервис SOFROS AI/ML: открытое API для работы с моделями машинного обучения

В ходе реализации проектов по нормализации НСИ эксперты SOFROS пришли к выводу: ни один инструмент не решает задачу самостоятельно.

В одних случаях эффективны шаблонные методы – они позволяют быстро выделять нормативы и стандартные параметры. В других – классическое машинное обучение. А для наиболее сложных формулировок, где важны контекст и семантика, применимы современные языковые модели (LLM). Они требуют больших вычислительных ресурсов, но обеспечивают высокое качество даже на неструктурированных описаниях.

Именно поэтому в сервисе SOFROS AI/ML применяется гибкое сочетание всех трёх подходов. Гибридный метод позволяет одновременно обрабатывать большие массивы записей с высокой точностью.

На основе структурированных данных решаются прикладные задачи:

  • поиск дублей;

  • подбор аналогов;

  • сопоставление со справочниками филиалов;

  • интеграция в технологические процессы.

Функциональные компоненты сервиса Sofros AI/ML

Архитектура сервиса включает четыре ключевых уровня. Разберём каждый.

Рисунок 1. Функциональная архитектура сервиса Sofros AI/ML

Рисунок 1. Функциональная архитектура сервиса Sofros AI/ML

1. Ядро сервиса

Ядро управляет всеми AI/ML-процессами, формирует SDK для работы с моделями и предоставляет интерфейс для взаимодействия с пользователями.

Оно состоит из:

  • автономного сервера взаимодействия – разработан на микросервисной архитектуре, поддерживает Windows и Linux. Взаимодействие с внешними системами – через REST API. Для тестирования предоставляется интерфейс Swagger (интерактивная документация API).

  • менеджеров сервисов – обеспечивают добавление моделей, их обучение, пополнение обучающих примеров и выполнение прогнозирования.

Также в составе ядра присутствует расширение для 1С:MDM Управление нормативно-справочной информацией, редакция 2.5. Оно реализует бизнес-логику нормализации, формирует SDK для взаимодействия с библиотеками AI от 1С и API для связи с автономным сервером.

Важно: в данный момент мы разрабатываем автономный клиент для интеграций с различными системами и сервисами. О нём и о методологии Spec-Driven Development (SDD) мы расскажем в одной из следующих статей цикла.

2. Модели AI/ML

Модели – это классы, содержащие методы для обучения, предсказания и оценки качества. Скрипты реализованы на Python.

В составе сервиса присутствуют следующие модели:

Модель

Какие задачи решает

Модель классификации

Наивный байесовский классификатор определяет категорию объекта (например, «кабель», «насос», «крепёж»).

Модель экстракции

Извлечение именованных сущностей (NER) выделяет из текста атрибуты – тип, сечение, материал, ГОСТ.

Модель семантического поиска

Генерация с дополнительной выборкой находит семантически похожие записи. Применяется для задач нечёткого поиска и сопоставления. Например, можно сопоставить две характеристики: “сечение жилы” и “сечения токопроводящих жил” для модели семантического поиска будут являться одинаковыми характеристиками.

Модель контекстного поиска

Вызов инструментов веб-поиска обогащает данные из внешних источников. Также модель контекстного поиска может использоваться для поиска новых видов характеристик.

PII-класс

Выделение персонально идентифицируемой информации (Personal Identifiable Information) для маскирования перед отправкой в LLM.

Подробнее об архитектуре и реализации каждой модели мы расскажем в следующих частях цикла.

3. Дополнительные модели и сервисы (доступны по запросу)

Модель или сервис

Какие задачи решает

MCP-сервер для 1С:MDM

Предоставляет инструменты для доступа к SDK моделей SOFROS AI/ML, данным и метаданным 1С:МДМ.

AI-модель NER на базе LLM GLiNER

Улучшенное выделение специфических типов НСИ. Работает zero-shot (без дообучения) или few-shot (с минимальным обучением). Встраивается в пайплайн ML-моделей.

Модель агломеративной кластеризации

Структурирует неразмеченные данные. Помогает создавать признаки для разметки, решать задачи сегментации, обнаруживать выбросы и аномалии, очищать и структурировать данные (используется для подготовки обучающих датасетов, помогает находить минимально необходимые примеры для обучения других моделей).

4. Инфраструктурный уровень

  • Провайдеры локальных и облачных LLM – вычислительные узлы (GPU-кластеры) для развертывания больших языковых моделей внутри периметра заказчика (опционально).

  • Библиотеки машинного обучения (ML) – готовые наборы инструментов, функций и алгоритмов, а также среда исполнения.

Как это работает в связке с MDM

В контексте MDM-системы (Master Data Management) интеллектуальный сервис встраивается в существующий контур и автоматически обрабатывает все входящие данные.

Для сотрудников процесс остаётся привычным: они работают в основной системе. Но каждая запись теперь проходит интеллектуальную обработку:

  1. приводится к единому корпоративному формату;

  2. извлекаются и нормализуются атрибуты;

  3. значения проверяются по справочным данным;

  4. выполняется валидация и контроль логических связей.

В итоге в MDM поступает корректная запись, которую эксперт только утверждает. Далее она становится доступной для всех взаимосвязанных систем, использующих единый номенклатурный справочник.

Важно подчеркнуть: SOFROS AI/ML не заменяет MDM-систему, а расширяет её возможности, снимая рутинную нагрузку с экспертов и автоматизируя нормализацию, проверку и структурирование данных.

Краткие выводы

  1. SOFROS AI/ML построен на гибридном подходе: шаблоны + классические ML-модели + LLM. Каждый инструмент решает свой класс задач.

  2. Ядро сервиса – это микросервисная архитектура с REST API, которая интегрируется с 1С:MDM, SAP и другими системами.

  3. В составе сервиса – модели для классификации, экстракции атрибутов, семантического и контекстного поиска, а также PII-маскировки.

  4. Сервис может работать как с облачными LLM, так и с локальными моделями внутри защищённого контура заказчика.

  5. Главная ценность – автоматизация полного цикла: от входящей «сырой» записи до эталонной «золотой записи».

Почему использовать сервис SOFROS AI/ML – это выгодно?

  • Сокращение ручного труда экспертов НСИ на 70-80%.

  • Снижение ошибок при закупках, комплектации и планировании.

  • Единый стандарт данных во всех филиалах и системах.

  • Работа с конфиденциальными данными без рисков благодаря локальным LLM и PII-маскировке.

Что дальше?

В следующей части цикла мы подробно рассмотрим архитектуру и реализацию моделей машинного обучения и искусственного интеллекта: как они обучаются, как оценивается их качество и как они встраиваются в общий пайплайн.

А пока задавайте вопросы в комментариях. Какая тема вам интереснее всего?

Если вас заинтересовал наш сервис, вы можете записаться на бесплатную консультацию и демонстрацию.

Автор: stentor123

Источник