Cohere Embed 5: две модели, одно векторное пространство и 128K контекста

Cohere выпустила семейство эмбеддинг-моделей Embed 5 — для корпоративного поиска, RAG и агентного поиска. В семействе две модели: Embed 5 Pro нацелена на максимальное качество поиска, Embed 5 Fast — на низкую задержку и стоимость на пути живого запроса. Обе принимают текст, изображения и объединённый ввод «текст + изображение», поддерживают более 100 языков и читают до 128K токенов. Главное конструктивное решение: Pro и Fast используют одно векторное пространство — индексировать корпус можно одной моделью, а запросы выполнять другой.

Модели уже доступны: API, Model Vault, Foundry и SageMaker

Обе модели общедоступны через Cohere API и Model Vault, Microsoft Foundry и Amazon SageMaker. Для приватного развёртывания в VPC или на собственном оборудовании используется vLLM.

Идентификаторы моделей в API — embed-v5.0-pro и embed-v5.0-fast. Обе выдают векторы размерности 2048, 1536, 1024, 768, 512 или 256, по умолчанию 2048. Форматы вывода — float, int8 или binary. Стоимость: Pro — $0,12 за 1M текстовых токенов, Fast — $0,08. Изображения на обоих тарифах стоят $0,40 за 1M токенов.

Embed 5 умеет векторизовать изображение страницы напрямую, а также объединять картинку с её метаданными в один вектор. Это важно для сканов, презентаций, схем и графиков, где извлечение текста теряет информацию. Родственная задача — вытащить содержимое из PDF до индексации: об этом в разборе Cohere Parse 5, которая превращает страницы в Markdown.

Один индекс, два пути запросов

Cohere протестировала все сочетания корпуса и запросов на 40 наборах данных для разработки. При нормировке «Pro + Pro» к 100 индекс, построенный Pro, а опрошенный Fast, набрал 98,4. Полностью Fast-схема — 96,6. Рекомендуемый шаблон: индексировать с Pro, запрашивать с Fast. Одно ограничение — обе стороны должны использовать одинаковую выходную размерность.

Такое разделение рассчитано на агентные сценарии: агент может выполнять десятки поисков на одну задачу, и задержка запросов накапливается. Команда Cohere сообщает, что Fast обрабатывает 377,3 документа в секунду против 159,7 у Pro. Похожая логика экономии на инференсе — у Ember-1 от Fireworks AI, которая тратит на 40% меньше токенов.

Бенчмарки: лидерство в финансах, смешанные результаты в мультиязычности

На ViDoRe V3 Embed 5 Pro в среднем набирает 85,8 — на 8,8 пункта больше, чем Embed 4. У Fast — 84,5. Voyage 4 Large набирает 83,7, Gemini Embedding 2 — 83,2, OpenAI text-embedding-3-large — 75,5. На наборе разобранных PDF от Cohere Pro лидирует с 84,8 против 83,6 у Voyage 4 Large.

Сильнее всего результаты в финансах. Pro занимает первое место на FinanceBench (80,1), FinQA (90,0) и ViDoRe V3 Finance (85,0). Fast — второй на всех трёх.

Мультиязычные результаты неоднородны. Pro лидирует по среднему для европейских языков — 77. Однако Gemini Embedding 2 обходит Pro на 9 из 10 дополнительных языков в собственной таблице результатов Cohere, включая японский, арабский, хинди и телугу.

Важная оговорка: большинство чисел получены с метрикой RCP-nDCG@10 — новым показателем Cohere. Он переупорядочивает фиксированный набор кандидатов, то есть измеряет качество переранжирования, а не первичного поиска. Cohere опубликовала код оценки, но независимая проверка пока не выполнена.

Экономия на хранении: 819 ГБ превращаются в 3,2 ГБ

Embed 5 использует Matryoshka-представление и выводы пониженной точности. Вектор размерности 2048 в float32 требует 8 КБ, 1024-мерный int8 — 1 КБ, 256-мерный binary — 32 байта. На 100 млн чанков сырое хранилище сокращается примерно с 819 ГБ до 3,2 ГБ. Cohere рекомендует по умолчанию 1024-мерный int8, ссылаясь на качество, близкое к полной точности.

Как Embed 5 выглядит на фоне конкурентов

Характеристика Embed 5 Pro Embed 5 Fast Voyage 4 Large Gemini Embedding 2 OpenAI text-embedding-3-large
Максимальный ввод 128K токенов 128K токенов 32 000 токенов 8 192 токена 8 191 токен
Типы ввода Текст, изображение, текст + изображение Текст, изображение, текст + изображение Текст Текст, изображение, видео, аудио, PDF Текст
Размерности 256–2048 (6 вариантов) 256–2048 (6 вариантов) 256, 512, 1024, 2048 128–3072 До 3072 (сокращаемые)
Форматы вывода float, int8, binary float, int8, binary float, int8, uint8, binary, ubinary float float
Языки 100+ 100+ Мультиязычная (число не опубликовано) 100+ Мультиязычная (число не опубликовано)
Общее пространство между тарифами Да (с Fast) Да (с Pro) Да (серия Voyage 4) Нет парного тарифа Нет парного тарифа
Цена за 1M текстовых токенов $0,12 $0,08 $0,12 $0,20 $0,13
Приватное развёртывание Да (VPC или on-prem через vLLM) Да (VPC или on-prem через vLLM) Через пакет модели в AWS Marketplace Нет (Gemini API, Vertex AI) Нет (только API)
ViDoRe V3, среднее (данные Cohere) 85,8 84,5 83,7 83,2 75,5

Что это значит для российских команд

Embed 5 распространяется только как облачный сервис Cohere, через Microsoft Foundry, Amazon SageMaker и приватное развёртывание в VPC или на собственном оборудовании через vLLM. Для российских компаний, работающих с персональными данными по 152-ФЗ, вариант с приватным развёртыванием через vLLM — единственный, который позволяет держать данные внутри контура, но он требует собственных GPU-мощностей. Облачные маршруты через Cohere API, Foundry и SageMaker предполагают передачу данных зарубежному провайдеру, что для многих задач неприемлемо. Если поиск по документам строится на открытых моделях, стоит сравнить качество Embed 5 с уже используемыми эмбеддингами на своих данных: метрика RCP-nDCG@10 измеряет переранжирование, а не первичный поиск, поэтому прямое сравнение с результатами вашего пайплайна может дать другую картину.

Частые вопросы

Что такое Cohere Embed 5?

Семейство мультимодальных мультиязычных эмбеддинг-моделей от Cohere, выпущенное 30 сентября 2026 года в двух тарифах — Pro и Fast. Обе модели принимают текст, изображения и их комбинацию.

Сколько стоит Embed 5?

Pro стоит $0,12, Fast — $0,08 за 1M текстовых токенов. Изображения на обоих тарифах — $0,40 за 1M токенов.

Можно ли смешивать эмбеддинги Pro и Fast?

Да. Они используют одно векторное пространство при условии, что обе стороны применяют одинаковую выходную размерность. Рекомендуемый шаблон — индексировать с Pro, запрашивать с Fast.

Какой размерностью векторов пользоваться?

Cohere рекомендует 1024-мерные векторы в int8 как компромисс по умолчанию: они дают качество, близкое к полной точности, и занимают 1 КБ на вектор вместо 8 КБ у 2048-мерного float32.

Насколько можно сэкономить на хранилище?

На 100 млн чанков переход с 2048-мерного float32 на 256-мерный binary сокращает сырое хранилище примерно с 819 ГБ до 3,2 ГБ. Binary-векторы подходят для первого прохода перед переранжированием.

Где можно развернуть Embed 5?

Модели доступны через Cohere API и Model Vault, Microsoft Foundry и Amazon SageMaker. Для приватного развёртывания в VPC или на собственном оборудовании используется vLLM.

Как Embed 5 сравнивается с конкурентами?

На ViDoRe V3 Pro набирает 85,8, Fast — 84,5, Voyage 4 Large — 83,7, Gemini Embedding 2 — 83,2, OpenAI text-embedding-3-large — 75,5. Это данные самой Cohere по метрике RCP-nDCG@10, независимая проверка пока не проводилась.

В чём подвох с бенчмарками Cohere?

Большинство чисел получены с метрикой RCP-nDCG@10, которая переупорядочивает фиксированный набор кандидатов и потому измеряет качество переранжирования, а не первичного поиска. Код оценки опубликован, но независимой репликации ещё нет. Кроме того, в мультиязычных тестах Gemini Embedding 2 обходит Pro на 9 из 10 дополнительных языков.

Источник: marktechpost.com