Marker 2: opensource-конвейер конвертации документов обходит MinerU, Docling и LiteParse по скорости и качеству

Datalab представила Marker 2 — практически полную переработку своего конвейера конвертации документов. Инструмент превращает PDF, изображения, PPTX, DOCX, XLSX, HTML и EPUB в Markdown, JSON, HTML или чанки. Новая версия собрана из трёх обновлённых компонентов: Surya OCR 2, компактной модели разметки на 20 млн параметров и переписанного pdftext, который стал в 3 раза быстрее предшественника.

Как измеряли

За точность отвечает olmOCR-bench от Allen AI (Ai2) — 1403 PDF-файла, примерно 8400 тестов «сдал/не сдал». Проверяют рендеринг математики, структуру таблиц, порядок чтения, обработку колонтитулов и старых сканов. Итоговая оценка — макро-усреднение по восьми категориям.

Результаты

Marker 2 vs MinerU. Marker 2 в сбалансированном режиме набирает 76,0% против 72,7% у MinerU. На «рождённых цифровыми» PDF разрыв минимален: 83,5% против 83,3%. Решающий аргумент — пропускная способность: 2,9 страницы/с против 0,54 страницы/с на одном B200 GPU, то есть в 5,4 раза быстрее при более высоком качестве.

Marker 2 vs Docling. Docling (выходец из IBM Research, MIT-лицензия) в общем зачёте показывает 50,3% при 2,1 страницы/с на том же стенде. Marker 2 обходит его с большим отрывом — 76,0% при 2,9 страницы/с. Сильная сторона Docling — форматная широта (аудио, email) и корпоративное управление, а не качество разбора PDF.

Marker 2 vs LiteParse. LiteParse (Rust, от команды LlamaIndex) — это про скорость, а не про качество: 22,4% в общем зачёте на CPU и 20,4% с отключённым OCR, зато 1721 страница/с. Marker 2 в CPU-режиме набирает 43,6% — более чем вдвое выше, хотя и всего 23,7 страницы/с.

Три режима Marker 2

Вместо одного конвейера Marker 2 предлагает три, которые переключаются автоматически в зависимости от доступного оборудования:

  • balanced — Surya VLM для разметки, пере-OCR при плохом тексте. 76,0% на olmOCR-bench. Требует GPU.
  • fast — лёгкий layout-детектор + pdftext, минимальное использование VLM. 66,6%.
  • --disable_ocr — только текстовый слой, никаких VLM-вызовов, работает на CPU. 43,6% при 23,7 страницы/с.

Режим определяется автоматически: balanced на GPU, fast на CPU/MPS, переопределяется флагом --mode.

Лицензирование — важный нюанс

Код Marker 2 распространяется под Apache 2.0. Веса моделей — под модифицированной AI Pubs OpenRAIL-M: бесплатно для исследований, личного использования и компаний с финансированием или выручкой до $5 млн. Всё, что выше, — нужна платная коммерческая лицензия.

Для сравнения: Docling — MIT (наиболее свободная лицензия), MinerU — Apache 2.0, но отдельная коммерческая лицензия требуется при аудитории свыше 100 млн MAU или выручке свыше $20 млн в месяц, а онлайн-сервисы на его основе обязаны раскрывать факт использования.

Кому это нужно

Marker 2 — инструмент не для обычного пользователя, а для тех, кто обрабатывает массивы документов: юридические фирмы, издательства, архивы, разработчики RAG-пайплайнов. Именно для них важен каждый процент точности на таблицах и математике, а пропускная способность определяет стоимость обработки. Сбалансированный режим Marker 2 вплотную приблизился к VLM-решениям вроде Gemini Flash 3.5 (76,0% против 76,4%) — отставание в 0,4 процентного пункта, но без оплаты за каждый вызов API.

Документы не уезжают за границу — и платить за API не нужно

Именно последний пункт делает Marker 2 практичным вариантом для российских команд. Облачные VLM-парсеры сопоставимого качества требуют подписки на зарубежный API: её и оплатить сложно, и загружать туда договоры, кадровые документы или сканы паспортов — это трансграничная передача персональных данных со всеми обязанностями по 152-ФЗ. Marker 2 работает на своём железе, документы не покидают контур, вопрос снимается целиком.

Ловушка — в лицензии на веса. Apache 2.0 распространяется только на код; веса идут под OpenRAIL-M, и компании крупнее порога в $5 млн формально обязаны купить коммерческую лицензию у Datalab — что для российского юрлица отдельная задача. Если это критично, стоит смотреть на Docling под MIT: он заметно слабее по качеству разбора, но не создаёт лицензионного риска.

Источник: marktechpost.com