Cohere выпустила Parse 5: модель извлекает данные из сложных документов в Markdown. cohere.. cohere. deepstack.. cohere. deepstack. llm.. cohere. deepstack. llm. markdown.. cohere. deepstack. llm. markdown. multimodal.. cohere. deepstack. llm. markdown. multimodal. ocr.. cohere. deepstack. llm. markdown. multimodal. ocr. parse 5.. cohere. deepstack. llm. markdown. multimodal. ocr. parse 5. ParseBench.. cohere. deepstack. llm. markdown. multimodal. ocr. parse 5. ParseBench. python.. cohere. deepstack. llm. markdown. multimodal. ocr. parse 5. ParseBench. python. selectel.. cohere. deepstack. llm. markdown. multimodal. ocr. parse 5. ParseBench. python. selectel. Блог компании Selectel.. cohere. deepstack. llm. markdown. multimodal. ocr. parse 5. ParseBench. python. selectel. Блог компании Selectel. искусственный интеллект.. cohere. deepstack. llm. markdown. multimodal. ocr. parse 5. ParseBench. python. selectel. Блог компании Selectel. искусственный интеллект. Машинное обучение.
Cohere выпустила Parse 5: модель извлекает данные из сложных документов в Markdown - 1

Компания Cohere выпустила коммерческую мультимодальную модель Parse 5 (parse-v5.0), которая помогает разработчикам извлекать структурированные данные из сложных корпоративных документов. Модель содержит 2,4 млрд параметров и конвертирует PDF-документы, включая финансовые отчеты и научные статьи, в Markdown. Одновременно Parse 5 определяет координаты ограничивающих рамок (bounding boxes) для каждого элемента, чтобы распознанный текст можно было сопоставить с исходным файлом.

Архитектура модели

Разработчики оптимизировали Parse 5 для работы под высокой нагрузкой. Модель поддерживает контекстное окно в 8K токенов и обрабатывает текст и изображения одновременно. В основе решения лежит открытая архитектура North-Micro-Vision-Instruct от Cohere Labs.

Конвейер обработки состоит из нескольких компонентов:

  • Визуальный кодер (Vision Encoder) на 400 млн параметров, созданный на базе SigLIP 2 SO400M. Чтобы сохранить структуру документа, кодер использует двумерные поворотные (RoPE) и обученные одномерные позиционные эмбеддинги.

  • Проектор (Projector) — модуль, который переносит извлеченные визуальные признаки напрямую в пространство эмбеддингов языковой модели.

  • North Micro LLM — основная языковая модель на 2 млрд параметров на базе архитектуры Cohere Command A+.

  • Метод интеграции DeepStack — решение заключается во внедрении патч-эмбеддингов (эмбеддингов фрагментов изображения) из визуального кодера в начальные слои языковой модели. Это дает LLM доступ к визуальным представлениям на разных уровнях абстракции..

Благодаря прямому выводу в Markdown разработчики предполагают устранить необходимость в использовании OCR-систем на основе правил.

Cohere выпустила Parse 5: модель извлекает данные из сложных документов в Markdown - 2

ИИ‑роутер — доступ к 300+ моделям из одной панели

Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.

Запустить ИИ‑роутер →

Тесты на бенчмарке ParseBench

Чтобы оценить точность распознавания, Cohere протестировала Parse 5 на бенчмарке ParseBench. В этот набор входят более 2 000 страниц реальных документов из финансовой, страховой и государственной сфер, проверенных людьми вручную. Тесты оценивают извлечение таблиц, точность передачи контекста и семантическое форматирование.

В бенчмарке Parse 5 показала вполне конкурентный результат в 79.2 балла. Лидером рейтинга стала GPT-5.5 с результатом 84.4 балла, LlamaParse набрала 78.3, а Mistral OCR — 75.05 балла.

Источник.

Интеграция

Координаты ограничивающих рамок помогают приложениям сопоставлять данные с оригинальным документом. Это критично для регулируемых отраслей, требующих строгого аудита и проверки информации.

Python:

import cohere

# Инициализируем клиент Cohere V2
co = cohere.ClientV2("YOUR_COHERE_API_KEY")

# Открываем сложный корпоративный PDF-файл
with open("quarterly_earnings_report.pdf", "rb") as file:
    document_content = file.read()

# Вызываем Parse API для извлечения Markdown
response = co.models.parse(
    model="parse-v5.0",
    document=document_content,
    output_format="markdown"
)

# Выводим структурированный результат
print("Extracted Markdown:n", response.text)
# Ограничивающие рамки для визуальной привязки элементов
print("Layout Elements:n", response.bounding_boxes)

cURL:

curl --request POST 
  --url https://api.cohere.com/v2/parse 
  --header 'Authorization: Bearer YOUR_COHERE_API_KEY' 
  --header 'Content-Type: multipart/form-data' 
  --form 'model=parse-v5.0' 
  --form 'document=@quarterly_earnings_report.pdf' 
  --form 'output_format=markdown'

Где протестировать и что говорит сообщество

Инструмент доступен на платформе Cohere, в Microsoft Azure AI Foundry и Amazon SageMaker на AWS. Оценить модель без интеграции в код можно в панели управления Cohere, на Hugging Face Space или локально, запустив открытую базовую модель North-Micro-Vision-Instruct.

На Reddit разработчики активно обсуждают технические характеристики и реализацию Parse 5. В сообществе r/Rag отмечают высокое качество распознавания таблиц, верный порядок чтения и низкую цену. Из минусов называют отсутствие встроенной поддержки PDF в текущей версии: перед отправкой в API приходится рендерить каждую страницу отдельно. Также пользователи ждут интеграции с OpenRouter. В r/LocalLLaMA тепло встретили модель North-Micro-Vision-Instruct с открытыми весами, отметив, что версия на 2,4 млрд параметров подходит для прототипирования и дообучения под конкретные задачи. В сообществе r/AIDeveloperNews модель хвалят за качественный перевод сложных файлов со встроенными таблицами и графикой в чистый Markdown.

С выходом Parse 5 компания Cohere выходит за пределы обработки исключительно текста, переходя на мультимодальные IT-решения. Уделяя приоритетное внимание надежному форматированию материала при минимальной задержке, компания ориентируется на разработчиков, работающих с неструктурированными данными из реального мира.

Автор: EkaterinaKoposova

Источник