Cohere выпустила Parse 5: модель извлекает данные из сложных документов в Markdown

Компания Cohere выпустила коммерческую мультимодальную модель Parse 5 (parse-v5.0), которая помогает разработчикам извлекать структурированные данные из сложных корпоративных документов. Модель содержит 2,4 млрд параметров и конвертирует PDF-документы, включая финансовые отчеты и научные статьи, в Markdown. Одновременно Parse 5 определяет координаты ограничивающих рамок (bounding boxes) для каждого элемента, чтобы распознанный текст можно было сопоставить с исходным файлом.

Архитектура модели

Разработчики оптимизировали Parse 5 для работы под высокой нагрузкой. Модель поддерживает контекстное окно в 8K токенов и обрабатывает текст и изображения одновременно. В основе решения лежит открытая архитектура North-Micro-Vision-Instruct от Cohere Labs.

Конвейер обработки состоит из нескольких компонентов:

  • Визуальный кодер (Vision Encoder) на 400 млн параметров, созданный на базе SigLIP 2 SO400M. Чтобы сохранить структуру документа, кодер использует двумерные поворотные (RoPE) и обученные одномерные позиционные эмбеддинги.

  • Проектор (Projector) — модуль, который переносит извлеченные визуальные признаки напрямую в пространство эмбеддингов языковой модели.

  • North Micro LLM — основная языковая модель на 2 млрд параметров на базе архитектуры Cohere Command A+.

  • Метод интеграции DeepStack — решение заключается во внедрении патч-эмбеддингов (эмбеддингов фрагментов изображения) из визуального кодера в начальные слои языковой модели. Это дает LLM доступ к визуальным представлениям на разных уровнях абстракции..

Благодаря прямому выводу в Markdown разработчики предполагают устранить необходимость в использовании OCR-систем на основе правил.

ИИ‑роутер — доступ к 300+ моделям из одной панели

Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.

Запустить ИИ‑роутер →

Тесты на бенчмарке ParseBench

Чтобы оценить точность распознавания, Cohere протестировала Parse 5 на бенчмарке ParseBench. В этот набор входят более 2 000 страниц реальных документов из финансовой, страховой и государственной сфер, проверенных людьми вручную. Тесты оценивают извлечение таблиц, точность передачи контекста и семантическое форматирование.

В бенчмарке Parse 5 показала вполне конкурентный результат в 79.2 балла. Лидером рейтинга стала GPT-5.5 с результатом 84.4 балла, LlamaParse набрала 78.3, а Mistral OCR — 75.05 балла.

Источник.Источник.

Интеграция

Координаты ограничивающих рамок помогают приложениям сопоставлять данные с оригинальным документом. Это критично для регулируемых отраслей, требующих строгого аудита и проверки информации.

Python:

import cohere# Инициализируем клиент Cohere V2co = cohere.ClientV2("YOUR_COHERE_API_KEY")# Открываем сложный корпоративный PDF-файлwith open("quarterly_earnings_report.pdf", "rb") as file: document_content = file.read()# Вызываем Parse API для извлечения Markdownresponse = co.models.parse( model="parse-v5.0", document=document_content, output_format="markdown")# Выводим структурированный результатprint("Extracted Markdown:n", response.text)# Ограничивающие рамки для визуальной привязки элементовprint("Layout Elements:n", response.bounding_boxes)

cURL:

curl --request POST  --url https://api.cohere.com/v2/parse  --header 'Authorization: Bearer YOUR_COHERE_API_KEY'  --header 'Content-Type: multipart/form-data'  --form 'model=parse-v5.0'  --form 'document=@quarterly_earnings_report.pdf'  --form 'output_format=markdown'

Где протестировать и что говорит сообщество

Инструмент доступен на платформе Cohere, в Microsoft Azure AI Foundry и Amazon SageMaker на AWS. Оценить модель без интеграции в код можно в панели управления Cohere, на Hugging Face Space или локально, запустив открытую базовую модель North-Micro-Vision-Instruct.

На Reddit разработчики активно обсуждают технические характеристики и реализацию Parse 5. В сообществе r/Rag отмечают высокое качество распознавания таблиц, верный порядок чтения и низкую цену. Из минусов называют отсутствие встроенной поддержки PDF в текущей версии: перед отправкой в API приходится рендерить каждую страницу отдельно. Также пользователи ждут интеграции с OpenRouter. В r/LocalLLaMA тепло встретили модель North-Micro-Vision-Instruct с открытыми весами, отметив, что версия на 2,4 млрд параметров подходит для прототипирования и дообучения под конкретные задачи. В сообществе r/AIDeveloperNews модель хвалят за качественный перевод сложных файлов со встроенными таблицами и графикой в чистый Markdown.

С выходом Parse 5 компания Cohere выходит за пределы обработки исключительно текста, переходя на мультимодальные IT-решения. Уделяя приоритетное внимание надежному форматированию материала при минимальной задержке, компания ориентируется на разработчиков, работающих с неструктурированными данными из реального мира.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев