Cohere Parse 5: VLM за $1,50 за 1000 страниц превращает PDF в Markdown

Cohere представила Parse 5 (parse-v5.0) — модель для разбора документов, ориентированную на высоконагруженное корпоративное использование. Это vision language model (VLM) на 2,3 млрд параметров с контекстным окном 8 192 токена и занимающая около 4,6 ГБ. Модель построена на архитектуре Cohere Labs North-Micro-Vision-Instruct.

Parse принимает страницы PDF, PPT или JPEG в виде base64-кодированного data URI и возвращает Markdown: текст в порядке чтения, таблицы в виде HTML, списки, пары «ключ — значение» из форм, описания изображений и координаты ограничивающих рамок. Отдельного этапа OCR перед моделью нет — распознавание происходит за один проход.

Где развернуть и кому подходит

Parse доступен в продакшене через Cohere Parse API, Microsoft Foundry, AWS SageMaker и однопользовательский Model Vault. Ожидания в листе ожидания нет, исследовательская лицензия не требуется.

Компания называет целевую аудиторию:

  • Средний бизнес с уже работающим RAG-стеком — можно начать с поминутной оплаты API, используя бесплатный пробный ключ.
  • Крупные предприятия с требованиями к резидентности данных или air-gap — для них предназначен Model Vault или приватное развертывание.
  • Стартапы на ранней стадии — экономика модели начинает оправдывать себя при объёме примерно от 100 000 страниц в месяц.

Основные вертикали: финансовые услуги, страхование, здравоохранение и науки о жизни, госсектор, телеком, энергетика и производство. Типичные сценарии — RAG-индексация, интеллектуальная обработка документов, пайплайны для претензий и счетов, поиск по контрактам и filings, а также передача документного контекста ИИ-агентам. Для агентных сценариев, работающих с большими объёмами документов внутри периметра, интересна и агентная модель Pokee-Isaac 28B с контекстом 10M токенов.

Два режима вывода

Практически важны два режима. По умолчанию модель возвращает строку Markdown на страницу. При установке output_format="blocks" возвращаются типизированные блоки: табличный блок несёт свой HTML, ограничивающую рамку и описание. Именно второй режим делает возможной трассируемость на уровне цитат.

Результат в ParseBench: 79,2 — но не весь бенчмарк

Cohere сообщает для Parse результат ParseBench 79,2 — впереди Mistral OCR 4 (74,5), Azure Document Intelligence (74,3) и Databricks AI Parse (72,4). ParseBench — это бенчмарк LlamaIndex на примерно 2 078 вручную проверенных корпоративных страницах, оцениваемых по пяти измерениям: таблицы, графики, точность контента, семантическое форматирование и визуальная привязка.

Цифра Cohere — среднее по трём измерениям: таблицы, точность контента и семантическое форматирование. Графики и визуальная привязка — два измерения, где большинство парсеров проваливаются, — исключены. На публичной таблице лидеров те же вендоры по полным пяти измерениям набирают заметно меньше: Mistral OCR 4 и Databricks AI Parse — по 60,68, Azure Document Intelligence (Layout) — 59,64. Среднее Azure по трём измерениям составляет 74,3, что точно совпадает с цифрой Cohere и подтверждает методологию. Сам Cohere Parse в этой таблице лидеров пока не значится; там лидирует LlamaParse Agentic с 84,88.

Итак, 79,2 — это заявленный вендором результат по подмножеству измерений, а не позиция в таблице лидеров. Проверить его на своих документах — разумная идея, и это заявлено как разумное утверждение для теста.

Цены: API против выделенных мощностей

API Cohere Parse стоит $1,50 за 1 000 страниц. На Model Vault Parse 5 обойдётся в $4,00/час или $2 500/месяц для инстанса Medium и $7,00/час или $4 300/месяц для XL.

Точка безубыточности, которую никто не публикует: при $0,0015 за страницу один инстанс Medium окупается при объёме примерно 1,67 млн страниц в месяц, XL — примерно 2,87 млн. Ниже этого порога дешевле поминутные вызовы API, выше — выделенные мощности выигрывают по цене, ещё до учёта требований к резидентности данных, которые обычно и есть реальная причина перехода предприятий на Vault. Если вы только присматриваетесь к открытым VLM для локального развертывания, обратите внимание и на Muse Glimmer от Meta: 30B-модель с открытыми весами помещается в 24 ГБ VRAM.

Частые вопросы

Чем Parse 5 отличается от обычного OCR?

В Parse нет отдельного этапа OCR. Это VLM, которая за один проход извлекает текст, порядок чтения, таблицы, списки, формы и координаты элементов. Обычный OCR обычно требует отдельного пайплайна для восстановления структуры документа.

Какие языки поддерживает модель?

Девять языков заявлены как стабильные: арабский, английский, французский, немецкий, итальянский, японский, корейский, португальский и испанский. Для остальных языков поддержка zero-shot с меньшей точностью.

Что даёт режим blocks?

Режим output_format="blocks" возвращает типизированные блоки вместо простой строки Markdown. Табличный блок содержит HTML, координаты рамки и описание, что позволяет ссылаться на конкретные фрагменты исходного документа.

Когда выгоднее Model Vault, а не API?

Выделенный инстанс Medium окупается при объёме от 1,67 млн страниц в месяц, XL — от 2,87 млн. Ниже этих объёмов поминутная оплата API дешевле. Но для предприятий с требованиями к резидентности данных Vault может быть единственным допустимым вариантом независимо от цены.

Насколько точен результат 79,2 в ParseBench?

Это заявленная самим Cohere цифра по трём из пяти измерений бенчмарка. Графики и визуальная привязка исключены. На публичной таблице лидеров по полным пяти измерениям модель пока не представлена, поэтому сравнивать её с конкурентами напрямую по этому числу нельзя.

Какие форматы принимает Parse?

PDF, PPT и JPEG. Страницы передаются как base64-кодированные data URI.

Можно ли попробовать Parse бесплатно?

Да, для API предусмотрен бесплатный пробный ключ. Это позволяет среднему бизнесу с RAG-стеком начать с поминутных вызовов, не покупая сразу выделенные мощности.

Источник: marktechpost.com