- BrainTools - https://www.braintools.ru -
Если нет времени читать всё, то вкратце: в октябре 2025 года отрасль OCR‑моделей для распознавания бухгалтерских документов пережила настоящий взрыв качества их работы. Благодаря этому нам удалось увеличить точность и производительность наших моделей в продуктах ИАД и Сайбокс:
Сократили длительность обработки счёта с 3–4 минут до 30 секунд с помощью замены тяжёлой Qwen2.5-VL-72B на оптимизированную nanonets‑ocr2-3b.
На 70% уменьшили объём проверок вручную, что особенно полезно для инструмента по сравнению документов (модель перестала добавлять мусор, не выдумывает числа и не искажает структуру).
Повысили пропускную способность в 5 раз на том же оборудовании. Сейчас модель весит меньше, и больше ресурсов остаётся на поточную обработку.
Таблицы теперь распознаются как HTML — за 1 секунду. Раньше приходилось гонять результат OCR через вторую LLM‑модель, чтобы распарсить таблицы.
Если интересно, как мы к этому пришли и какую пользу от проведённого нашей командой исследования получили наши продукты, то заходите.
Статья состоит из двух частей: первая про бизнес, вторая про технические подробности реализации и исследования.
Раньше обработка счетов и договоров занимала 3–4 минуты на документ и требовала проверки вручную почти в 60% случаев. Особенно критично это было для обработки юридических документов: старые модели (включая Qwen2.5-VL-72B) галлюцинировали, добавляли лишние строки и путали таблицы, что превращало автоматизацию в дополнительный источник ошибок и труда. Мы решили пересмотреть всю цепочку, от входного изображения до структурированного вывода.
Раньше для парсинга таблиц приходилось гонять результат OCR через вторую LLM‑модель. Это удлиняло обработку не менее чем на 30 секунд, приводило к новым галлюцинациям и проблемам. Сейчас это чистый HTML, который парсится классическим кодом, то есть никаких дополнительных запросов и ошибок второго уровня. Фактически, в результате исследования и разработки мы получили новую архитектуру обработки документов. Отпала необходимость в виде промежуточных звеньев в виде других тяжеловесных LLM.
Сейчас эта конфигурация внедрена в пилотные потоки анализа финансовых документов в ИАД. Модель развёрнута на платформе Сайбокс [1]. Дальше планируем масштабирование на другие типы документов (накладные, технические задания и прочее) и инструменты платформы.
Какие преимущества от исследовательского проекта для наших решений?
Для Сайбокс: снижение нагрузки на инфраструктуру, отказ от тяжёлых моделей и повышение пропускной способности при пакетной обработке документов на тех же мощностях GPU.
Для ИАД: снижение вероятности юридических ошибок, ускорение цикла обработки, чёткие значения для разных сценариев (30 секунд, 70%, 5x), понятный язык без «нужна предобработка».
Исследование направлено на поиск оптимальных методов предобработки изображений и получение данных из табличных и текстовых документов при распознавании.
Табличные данные занимали целый лист А4, вот небольшой пример:

Модели, которые мы тестировали:
nanonets‑ocr2-3b
tesseract oct
paddle ocr
logics‑parsing
Nanonets‑OCR‑s
LightOnOCR-1B
Qwen2.5-VL-72B
olmOCR-7b-0725-FP8
dots.ocr
Также мы тестировали такие виды предварительной обработки:
перевод в ч/б;
поворот;
перевод в оттенки серого;
увеличение контрастности;
увеличение резкости;
наложение фильтра Unsharp mask;
бинаризация;
улучшение краёв.
После проведения комплексного исследования восьми различных OCR‑моделей и множества методов предобработки изображений мы пришли к следующим ключевым выводам.
Выбор модели. Для максимального качества распознавания рекомендуется использовать модель nanonets‑ocr2-3b. Она показала наилучшие результаты по точности распознавания «проблемных» числовых значений (например, 480.80 и 483.80) и демонстрирует стабильно высокое качество при работе с документами, содержащими таблицы. Модель успешно распознаёт все строки таблицы и корректно извлекает числовые данные даже в сложных случаях, когда другие модели допускают ошибки [2].
Для задач, требующих баланса между скоростью и качеством, оптимальным выбором является LightOnOCR-1B. Эта модель обеспечивает приемлемое качество распознавания при значительно более высокой скорости обработки по сравнению с более крупными моделями. LightOnOCR-1B подходит для массовой обработки документов, когда критична скорость, но качество должно оставаться на приемлемом уровне.
Модель dots.ocr оказалась сопоставимой с nanonets‑ocr2-3b по качеству распознавания наших бухгалтерских документов, при этом работала быстрее. Поэтому мы добавили dots.ocr в качестве быстрого режима распознавания (особенно для пакетной обработки), а nanonets‑ocr2-3b оставили как референс по качеству.
Формат вывода для таблиц. При работе с документами, содержащими таблицы, обязательно необходимо использовать HTML‑формат вывода. Он позволяет сохранить структуру таблиц, корректно распознать границы ячеек и извлечь данные в структурированном виде. Другие форматы (текстовый, Markdown) не обеспечивают достаточной структурированности данных и затрудняют последующую обработку таблиц.
Предобработка изображений. Из всех протестированных методов предобработки эффективными оказались только два: перевод в чёрно‑белое (ч/б) и поворот изображения. Перевод в ч/б улучшает контрастность и помогает модели лучше различать текст и фон, особенно при работе с отсканированными документами. Поворот необходим для корректной ориентации документа, если он был отсканирован в неправильном положении, даже небольшой наклон может влиять на итоговый результат.
Все остальные методы предобработки (увеличение контрастности, резкости, бинаризация, улучшение краёв и так далее) не улучшили или даже ухудшили качество распознавания. Современные OCR‑модели на основе глубокого обучения [3] уже содержат встроенные механизмы обработки изображений и лучше работают с минимально обработанными данными. Избыточная предобработка может вносить артефакты и искажения, которые мешают модели корректно распознавать текст.
Agentic Document Extraction (ADE). Чтобы повысить качество распознавания сложных документов — например, больших таблиц с дополнительными элементами, — можно разбивать страницу на смысловые области. С помощью Docling Heron извлекайте фрагменты страницы — например, таблицу, шапку, подписи — и по частям отправляйте их в LLM/OCR по частям, затем собирая итоговый документ. Такой конвейер обычно даёт лучшее качество распознавания, потому что модель работает с меньшим контекстом и не «смешивает» зоны.
Практические рекомендации. Для достижения наилучших результатов при распознавании документов с таблицами рекомендуется использовать следующую конфигурацию: модель nanonets‑ocr2-3b с HTML форматом вывода, минимальная предобработка (только перевод в ч/б и поворот при необходимости), DPI конвертации в PDF не менее 200 точек на дюйм. Если для вас важнее скорость, то используйте модель dots.ocr с теми же рекомендациями: HTML для таблиц, минимальная предобработка, DPI не менее 200 точек на дюйм.
Авторы:
Ринат Шакиров ‑– ML/DS разработчик, ИАД
Шатилов Виталий ‑– MLOps / Full‑stack AI engineer, Сайбокс
Автор: T1_IT
Источник [4]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/34545
URLs in this post:
[1] платформе Сайбокс: https://t1v.scibox.tech/
[2] ошибки: http://www.braintools.ru/article/4192
[3] обучения: http://www.braintools.ru/article/5125
[4] Источник: https://habr.com/ru/companies/T1Holding/articles/1069672/?utm_campaign=1069672&utm_source=habrahabr&utm_medium=rss
Нажмите здесь для печати.