Cohere выпустила семейство эмбеддинг-моделей Embed 5 — для корпоративного поиска, RAG и агентного поиска. В семействе две модели: Embed 5 Pro нацелена на максимальное качество поиска, Embed 5 Fast — на низкую задержку и стоимость на пути живого запроса. Обе принимают текст, изображения и объединённый ввод «текст + изображение», поддерживают более 100 языков и читают до 128K токенов. Главное конструктивное решение: Pro и Fast используют одно векторное пространство — индексировать корпус можно одной моделью, а запросы выполнять другой.
Модели уже доступны: API, Model Vault, Foundry и SageMaker
Обе модели общедоступны через Cohere API и Model Vault, Microsoft Foundry и Amazon SageMaker. Для приватного развёртывания в VPC или на собственном оборудовании используется vLLM.
Идентификаторы моделей в API — embed-v5.0-pro и embed-v5.0-fast. Обе выдают векторы размерности 2048, 1536, 1024, 768, 512 или 256, по умолчанию 2048. Форматы вывода — float, int8 или binary. Стоимость: Pro — $0,12 за 1M текстовых токенов, Fast — $0,08. Изображения на обоих тарифах стоят $0,40 за 1M токенов.
Embed 5 умеет векторизовать изображение страницы напрямую, а также объединять картинку с её метаданными в один вектор. Это важно для сканов, презентаций, схем и графиков, где извлечение текста теряет информацию. Родственная задача — вытащить содержимое из PDF до индексации: об этом в разборе Cohere Parse 5, которая превращает страницы в Markdown.
Один индекс, два пути запросов
Cohere протестировала все сочетания корпуса и запросов на 40 наборах данных для разработки. При нормировке «Pro + Pro» к 100 индекс, построенный Pro, а опрошенный Fast, набрал 98,4. Полностью Fast-схема — 96,6. Рекомендуемый шаблон: индексировать с Pro, запрашивать с Fast. Одно ограничение — обе стороны должны использовать одинаковую выходную размерность.
Такое разделение рассчитано на агентные сценарии: агент может выполнять десятки поисков на одну задачу, и задержка запросов накапливается. Команда Cohere сообщает, что Fast обрабатывает 377,3 документа в секунду против 159,7 у Pro. Похожая логика экономии на инференсе — у Ember-1 от Fireworks AI, которая тратит на 40% меньше токенов.
Бенчмарки: лидерство в финансах, смешанные результаты в мультиязычности
На ViDoRe V3 Embed 5 Pro в среднем набирает 85,8 — на 8,8 пункта больше, чем Embed 4. У Fast — 84,5. Voyage 4 Large набирает 83,7, Gemini Embedding 2 — 83,2, OpenAI text-embedding-3-large — 75,5. На наборе разобранных PDF от Cohere Pro лидирует с 84,8 против 83,6 у Voyage 4 Large.
Сильнее всего результаты в финансах. Pro занимает первое место на FinanceBench (80,1), FinQA (90,0) и ViDoRe V3 Finance (85,0). Fast — второй на всех трёх.
Мультиязычные результаты неоднородны. Pro лидирует по среднему для европейских языков — 77. Однако Gemini Embedding 2 обходит Pro на 9 из 10 дополнительных языков в собственной таблице результатов Cohere, включая японский, арабский, хинди и телугу.
Важная оговорка: большинство чисел получены с метрикой RCP-nDCG@10 — новым показателем Cohere. Он переупорядочивает фиксированный набор кандидатов, то есть измеряет качество переранжирования, а не первичного поиска. Cohere опубликовала код оценки, но независимая проверка пока не выполнена.
Экономия на хранении: 819 ГБ превращаются в 3,2 ГБ
Embed 5 использует Matryoshka-представление и выводы пониженной точности. Вектор размерности 2048 в float32 требует 8 КБ, 1024-мерный int8 — 1 КБ, 256-мерный binary — 32 байта. На 100 млн чанков сырое хранилище сокращается примерно с 819 ГБ до 3,2 ГБ. Cohere рекомендует по умолчанию 1024-мерный int8, ссылаясь на качество, близкое к полной точности.
Как Embed 5 выглядит на фоне конкурентов
| Характеристика | Embed 5 Pro | Embed 5 Fast | Voyage 4 Large | Gemini Embedding 2 | OpenAI text-embedding-3-large |
|---|---|---|---|---|---|
| Максимальный ввод | 128K токенов | 128K токенов | 32 000 токенов | 8 192 токена | 8 191 токен |
| Типы ввода | Текст, изображение, текст + изображение | Текст, изображение, текст + изображение | Текст | Текст, изображение, видео, аудио, PDF | Текст |
| Размерности | 256–2048 (6 вариантов) | 256–2048 (6 вариантов) | 256, 512, 1024, 2048 | 128–3072 | До 3072 (сокращаемые) |
| Форматы вывода | float, int8, binary | float, int8, binary | float, int8, uint8, binary, ubinary | float | float |
| Языки | 100+ | 100+ | Мультиязычная (число не опубликовано) | 100+ | Мультиязычная (число не опубликовано) |
| Общее пространство между тарифами | Да (с Fast) | Да (с Pro) | Да (серия Voyage 4) | Нет парного тарифа | Нет парного тарифа |
| Цена за 1M текстовых токенов | $0,12 | $0,08 | $0,12 | $0,20 | $0,13 |
| Приватное развёртывание | Да (VPC или on-prem через vLLM) | Да (VPC или on-prem через vLLM) | Через пакет модели в AWS Marketplace | Нет (Gemini API, Vertex AI) | Нет (только API) |
| ViDoRe V3, среднее (данные Cohere) | 85,8 | 84,5 | 83,7 | 83,2 | 75,5 |
Что это значит для российских команд
Embed 5 распространяется только как облачный сервис Cohere, через Microsoft Foundry, Amazon SageMaker и приватное развёртывание в VPC или на собственном оборудовании через vLLM. Для российских компаний, работающих с персональными данными по 152-ФЗ, вариант с приватным развёртыванием через vLLM — единственный, который позволяет держать данные внутри контура, но он требует собственных GPU-мощностей. Облачные маршруты через Cohere API, Foundry и SageMaker предполагают передачу данных зарубежному провайдеру, что для многих задач неприемлемо. Если поиск по документам строится на открытых моделях, стоит сравнить качество Embed 5 с уже используемыми эмбеддингами на своих данных: метрика RCP-nDCG@10 измеряет переранжирование, а не первичный поиск, поэтому прямое сравнение с результатами вашего пайплайна может дать другую картину.
Частые вопросы
Что такое Cohere Embed 5?
Семейство мультимодальных мультиязычных эмбеддинг-моделей от Cohere, выпущенное 30 сентября 2026 года в двух тарифах — Pro и Fast. Обе модели принимают текст, изображения и их комбинацию.
Сколько стоит Embed 5?
Pro стоит $0,12, Fast — $0,08 за 1M текстовых токенов. Изображения на обоих тарифах — $0,40 за 1M токенов.
Можно ли смешивать эмбеддинги Pro и Fast?
Да. Они используют одно векторное пространство при условии, что обе стороны применяют одинаковую выходную размерность. Рекомендуемый шаблон — индексировать с Pro, запрашивать с Fast.
Какой размерностью векторов пользоваться?
Cohere рекомендует 1024-мерные векторы в int8 как компромисс по умолчанию: они дают качество, близкое к полной точности, и занимают 1 КБ на вектор вместо 8 КБ у 2048-мерного float32.
Насколько можно сэкономить на хранилище?
На 100 млн чанков переход с 2048-мерного float32 на 256-мерный binary сокращает сырое хранилище примерно с 819 ГБ до 3,2 ГБ. Binary-векторы подходят для первого прохода перед переранжированием.
Где можно развернуть Embed 5?
Модели доступны через Cohere API и Model Vault, Microsoft Foundry и Amazon SageMaker. Для приватного развёртывания в VPC или на собственном оборудовании используется vLLM.
Как Embed 5 сравнивается с конкурентами?
На ViDoRe V3 Pro набирает 85,8, Fast — 84,5, Voyage 4 Large — 83,7, Gemini Embedding 2 — 83,2, OpenAI text-embedding-3-large — 75,5. Это данные самой Cohere по метрике RCP-nDCG@10, независимая проверка пока не проводилась.
В чём подвох с бенчмарками Cohere?
Большинство чисел получены с метрикой RCP-nDCG@10, которая переупорядочивает фиксированный набор кандидатов и потому измеряет качество переранжирования, а не первичного поиска. Код оценки опубликован, но независимой репликации ещё нет. Кроме того, в мультиязычных тестах Gemini Embedding 2 обходит Pro на 9 из 10 дополнительных языков.
Источник: marktechpost.com