Saaras V4 от Sarvam AI: распознавание речи для 22 индийских языков

Sarvam AI представила Saaras V4 — новое поколение модели распознавания речи. Она охватывает все 22 запланированных индийских языка (scheduled languages) плюс английский, включая его глобальные акценты. Вендор заявляет о рекордной точности (state-of-the-art) по всем 22 языкам.

Развернуть модель можно только через API Sarvam, указав model="saaras:v4". Веса не открыты, а документация по самостоятельному развёртыванию в SageMaker пока описывает лишь Saaras v3. Для сравнения: Gemini 3.5 Transcribe от Google тоже доступна только через API, но с двумя интерфейсами.

Как устроена Saaras V4

Это система «энкодер — декодер». Аудиоэнкодер превращает звуковую волну в эмбеддинги, несущие фонетические и акустические детали. Затем адаптер временного прореживания (temporal-downsampling adapter) укорачивает последовательность и проецирует её в пространство эмбеддингов языковой модели — так длинные записи укладываются в контекстный бюджет декодера.

Декодер — Sarvam-3B, гибридная state-space языковая модель на 3 млрд параметров, обученная с нуля внутри компании. Она читает аудиопризнаки вместе с текстовым промптом и авторегрессивно выдаёт транскрипт, подавая каждый токен обратно на вход для следующего шага.

Результаты бенчмарков

Английский. Sarvam проверила 7 англоязычных датасетов. Шесть взяты из Open ASR Leaderboard на Hugging Face: AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech и VoxPopuli. Седьмой — Svarah от AI4Bharat с индийским акцентом. Оценка велась по коду нормализации из лидерборда. Saaras V4 показала самую низкую среднюю WER среди моделей, которые тестировала Sarvam.

Индийские языки. На наборе Vistaar Sarvam приводит результаты по 10 индийским языкам с использованием WER и LLM-WER. Метрика LLM-WER добавляет семантическую проверку: она отделяет реальные смысловые ошибки от безобидных орфографических и форматных вариаций, обычных для индийских письменностей.

Шумное аудио. На Kathbath Noisy, измеренном по LLM-WER, Sarvam утверждает, что частота ошибок Saaras V4 менее чем вдвое ниже, чем у Deepgram Nova-3 и GPT-4o Transcribe. В набор входят сжатые, клиппированные записи и файлы с сильным фоном.

Определение языка. На проверенных высказываниях IndicVoices ошибка идентификации языка составляет 2,9% для топ-10 индийских языков и 5,22% для всех 22.

Важно: все приведённые цифры — от вендора. Независимой проверки пока не публиковалось.

Пять режимов вывода из одной модели

Одно и то же аудио можно вернуть в 5 представлениях, выбираемых параметром mode:

  • transcribe (по умолчанию) — родное письмо с нормализованными числами и датами;
  • verbatim — каждое слово как произнесено, с сохранением слов-заполнителей и произнесённых чисел;
  • codemix — родное письмо, но английские слова остаются на английском;
  • translit — вся фраза латиницей;
  • translate — перевод на английский с нормализованными числами.

Логика Sarvam проста: обработка этих вариантов внутри модели убирает шаги постобработки, которые могут накапливать ошибки.

Keyterm prompting

Подсказка ключевых слов (keyterm prompting) — новшество V4, работает только с saaras:v4. Вы передаёте JSON-список в поле keyterms: до 50 терминов по 64 символа каждый. Подсказки смещают распознавание, но не гарантируют результат. Если бренд вроде PhonePe должен остаться латиницей, используйте режим codemix.

На бенчмарке IndicContextEval (статья, Interspeech 2026) Saaras V4 показывает WER 16,03% в настройке L5 с подсказкой ключевых слов. Sarvam называет это лучшим результатом на бенчмарке.

Потоковая передача, длинное аудио и цены

  • Потоковая передача: WebSocket с частичными результатами и временем до первого токена менее 150 мс.
  • REST: синхронная транскрипция клипов до 30 секунд.
  • Batch: асинхронные задачи до 2 часов на файл с опциональной диаризацией спикеров.
  • SDK: Python 3.9+ и Node.js 18+, а также интеграции с LiveKit Agents, Pipecat и Vercel AI SDK.
  • Цена: Sarvam указывает 30 рупий в час за распознавание речи в реальном времени, потоковом и пакетном режимах и 45 рупий в час с диаризацией.

Saaras v3 остаётся моделью по умолчанию. Форма запроса у V4 та же, так что переключение — изменение одной строки.

Сравнение с конкурентами

Sarvam сравнивала Saaras V4 с тремя системами. Данные взяты из публичной документации и прайс-листов каждого вендора, проверенных 26 сентября 2026 года.

Характеристика Saaras V4 Deepgram Nova-3 ElevenLabs Scribe v2 OpenAI GPT-4o Transcribe
Индийские scheduled languages (из 22) 22 11 14 Не указано по языкам
Всего языков 23 (22 индийских + английский) 45+ 90+ Мультиязычная
Смещение по ключевым словам До 50 терминов Да, платная надстройка До 1000 (batch), 50 (realtime), платная надстройка Свободный текстовый промпт
Встроенные режимы вывода 5 (transcribe, verbatim, codemix, translit, translate) Транскрипт плюс Smart Formatting Verbatim или no_verbatim Транскрипт
Потоковая передача в реальном времени WebSocket, менее 150 мс TTFT (заявление вендора) Да (WebSocket) Scribe v2 Realtime, около 150 мс Потоковая передача файлов; live через Realtime API
Диаризация спикеров Batch API Да До 32 спикеров Отдельная модель gpt-4o-transcribe-diarize
Цена по прайсу 30 рупий/час $0,0052/мин (мультиязычная, запись) $0,22/час (batch) ~$0,006/мин
Самостоятельный хостинг Пока нет для V4 (v3 на SageMaker) Да Облачный API Облачный API

Главное

  • Saaras V4 покрывает все 22 индийских языка плюс глобальный английский в одной модели.
  • За аудиоэнкодером стоит декодер Sarvam-3B — гибридная state-space модель, обученная с нуля.
  • Keyterm prompting принимает до 50 терминов и даёт WER 16,03% на IndicContextEval L5.
  • 5 режимов вывода и TTFT менее 150 мс в потоковом режиме — из одной модели.
  • Пока только API по 30 рупий в час; документация по самостоятельному хостингу всё ещё описывает v3.

Частые вопросы

Кого касается выход Saaras V4?

В первую очередь разработчиков и компании, которым нужно распознавать индийские языки: сервисы поддержки, колл-центры, приложения для локальных рынков. Модель доступна только через API Sarvam, поэтому для работы с ней нужен доступ к этому облаку.

Можно ли развернуть Saaras V4 на своём сервере?

Нет. Веса не опубликованы, а документация Sarvam по самостоятельному развёртыванию в SageMaker пока покрывает только Saaras v3. Для V4 доступен лишь облачный API.

Как переключиться с Saaras v3 на V4?

Форма запроса у V4 та же, что у v3, поэтому достаточно изменить значение параметра model на saaras:v4. Одна строка кода. Saaras v3 при этом остаётся моделью по умолчанию.

Что такое keyterm prompting и когда он нужен?

Это передача списка ключевых слов в поле keyterms — до 50 терминов по 64 символа. Подсказки смещают распознавание в нужную сторону, но не гарантируют, что термин появится в выводе. Для брендов, которые должны остаться латиницей, нужен режим codemix.

Чем режимы вывода отличаются друг от друга?

Режим transcribe даёт родное письмо с нормализованными числами и датами. verbatim сохраняет слова-заполнители и произнесённые числа. codemix оставляет английские слова на английском. translit переводит всю фразу в латиницу. translate выдаёт английский перевод с нормализованными числами.

Сколько стоит использование Saaras V4?

Sarvam указывает 30 рупий в час за распознавание речи в реальном времени, потоковом и пакетном режимах. С диаризацией спикеров цена — 45 рупий в час.

Есть ли независимые подтверждения заявленной точности?

Нет. Все приведённые цифры — от вендора, независимой проверки пока не публиковалось. Это касается и сравнения с Deepgram Nova-3, ElevenLabs Scribe v2 и GPT-4o Transcribe: данные взяты из публичной документации конкурентов на 26 сентября 2026 года.

Какие ограничения по длине аудио?

Синхронный REST-запрос принимает клипы до 30 секунд. Пакетный режим обрабатывает файлы до 2 часов, при необходимости с диаризацией спикеров. Для реального времени используется WebSocket с частичными результатами. Если нужно развернуть похожие модели локально, посмотрите на ThinkingCap-Qwen3.8-27B, которая экономит токены рассуждения.

Источник: marktechpost.com