Microsoft MAI-Transcribe-2-Streaming: потоковое распознавание речи с WER 2,5%

Microsoft AI выпустила MAI-Transcribe-2-Streaming — свою первую потоковую модель распознавания речи. Релиз состоялся 1 октября 2026 года вместе с двумя моделями синтеза речи, MAI-Voice-2.1 и MAI-Voice-2.1-Flash. В тесте Artificial Analysis модель заняла первое место среди 38 участников как по точности финальной расшифровки, так и по точности первого частичного результата.

Новинка ориентирована на голосовых агентов, живые субтитры и диктовку — сценарии, где задержка определяет качество работы. Это потоковый вариант пакетной модели MAI-Transcribe-2, вышедшей в сентябре.

60 языков и первые гипотезы через 100 мс

Модель распознаёт 60 языков с автоматическим непрерывным определением языка. Аудио поступает в потоковом режиме, а текст возвращается, пока говорящий ещё не закончил фразу.

Первые гипотезы, которые Microsoft называет partials, появляются чуть более чем через 100 мс после получения аудио. Модель уточняет их по мере поступления контекста, а затем фиксирует стабильную финальную расшифровку. Агент может начать рассуждать или вызывать инструменты прямо посреди предложения. По внутренним тестам Microsoft, слова появляются в два раза быстрее, чем у ближайшего конкурента.

Что измерила Artificial Analysis

Индекс AA-WER Streaming использует около 8 часов аудио: 50% — AA-AgentTalk, 25% — VoxPopuli, 25% — Earnings22. Задержка отсчитывается от конца речи, который определяет SileroVAD.

  • Финальная расшифровка: 2,5% WER через 0,13 с после конца речи, первое место из 38 моделей.
  • Первый частичный результат: 2,5% WER через 0,12 с после конца речи, тоже первое место.

Ближайшие преследователи — Grok Voice Transcribe 2.0 с 2,7% и 0,49 с, а также Muse Voice Transcribe с 3,1% и 0,16 с. Самая быстрая модель в тесте — Cartesia Ink-2 (внешние эндпоинты) — выдаёт финал за 0,07 с, но при 4,0% WER.

Ключевой момент: первый частичный результат точен так же, как финальный. Это важно для агентов, которые действуют, не дожидаясь конца фразы. Microsoft также относит модель к границе Парето по соотношению точности и задержки.

Цена: $0,54 за час, вводная ставка до конца 2026 года

MAI-Transcribe-2-Streaming стоит $0,54 за час аудио. Это вводная цена, действующая до конца 2026 года. Artificial Analysis нормализует её до $9,00 за 1000 минут. Пакетная MAI-Transcribe-2 обходится в $0,10 за час.

На потоковом распознавании Microsoft берёт больше, чем xAI и Meta, и примерно совпадает с оценочной ставкой Google.

Два пути интеграции

Microsoft описывает два способа подключения:

  • Realtime API — для приложений, уже использующих WebSocket, совместимый с OpenAI Realtime.
  • Azure Speech SDK — управляет соединением, повторами и потоковой передачей аудио.

Оба возвращают промежуточные и финальные результаты. Модель также доступна в MAI Playground, через Vercel и Azure Voice Live. Поддержка LiveKit указана как «скоро».

Для полного голосового цикла Microsoft предлагает связку с MAI-Voice-2.1-Flash: она генерирует 45 с аудио при сквозной задержке 150 мс за $15 за 1 млн символов. MAI-Voice-2.1 покрывает 23 языка и 26 локалей по $22 за 1 млн символов.

Сравнение с конкурентами

Параметр MAI-Transcribe-2-Streaming Grok Voice Transcribe 2.0 Muse Voice Transcribe Gemini 3.5 Transcribe Live
Разработчик Microsoft AI xAI Meta Superintelligence Labs Google
Релиз 1 октября 2026 18 сентября 2026 1 сентября 2026 26 августа 2026
AA-WER Streaming (финал) 2,5% 2,7% 3,1% 4,0%
Время до финала 0,13 с 0,49 с 0,16 с Не указано в источнике AA
Цена потока за час $0,54 (вводная) $0,20 $0,18 ~$0,54 (оценка по токенам)
Языки 60, непрерывное автоопределение Десятки, автоопределение, переключение по ходу записи 70+ обучено, 25 проверено 85+, автоопределение
Диаризация в потоке Не указано Есть в API (поток не подтверждён) Да, 20+ говорящих Не поддерживается в Live
Интерфейс Realtime API (WebSocket) + Azure Speech SDK WebSocket WebSocket + файловый эндпоинт Live API (WebSocket)
Открытые веса Нет Нет Нет Нет

Что это значит для разработчиков

Модель вышла в публичной превью, без SLA и без открытых весов. Для команд, строящих голосовых агентов, это означает: можно рассчитывать на низкую задержку и высокую точность первого частичного результата, но не на гарантии доступности и не на развёртывание в собственном контуре. Цена на потоковое распознавание у Microsoft выше, чем у xAI и Meta, — при выборе стоит сопоставлять бюджет с требованиями к задержке.

Если вы уже используете Gemini 3.5 Transcribe или присматриваетесь к Saaras V4 от Sarvam AI, новая модель Microsoft даёт ещё одну точку сравнения по WER и задержке. А для проектов, где важна работа с открытыми моделями, пригодятся и другие свежие релизы из подборки ИИ-моделей.

Частые вопросы

Кого касается этот релиз?

В первую очередь разработчиков голосовых агентов, сервисов живых субтитров и диктовки, которым важна задержка. Модель доступна в публичной превью, поэтому подходит для прототипов и пилотов, но не для критичных продакшн-систем без SLA.

Какая точность у модели?

2,5% WER на финальной расшифровке через 0,13 с после конца речи и те же 2,5% WER на первом частичном результате через 0,12 с. Оба показателя — первые места среди 38 моделей в индексе AA-WER Streaming.

Сколько стоит использование?

$0,54 за час аудио по вводной цене до конца 2026 года. Artificial Analysis нормализует это до $9,00 за 1000 минут. Для сравнения: пакетная MAI-Transcribe-2 стоит $0,10 за час.

Сколько языков поддерживается?

60 языков с автоматическим непрерывным определением языка. Переключение между языками происходит без ручной настройки.

Как подключить модель?

Два пути: Realtime API для приложений на WebSocket, совместимом с OpenAI Realtime, и Azure Speech SDK для управления соединением, повторами и потоковой передачей аудио. Оба возвращают промежуточные и финальные результаты.

Есть ли открытые веса?

Нет. Модель доступна только через облачные сервисы Microsoft — Realtime API, Azure Speech SDK, MAI Playground, Vercel и Azure Voice Live. Развернуть её локально нельзя.

Что такое частичные результаты и зачем они нужны?

Это промежуточные гипотезы, которые модель выдаёт, пока говорящий ещё не закончил фразу. Они позволяют агенту начать действовать — рассуждать или вызывать инструменты — не дожидаясь финальной расшифровки. В случае MAI-Transcribe-2-Streaming точность частичных результатов не уступает финальным.

Насколько быстро модель выдаёт текст?

Первые гипотезы появляются чуть более чем через 100 мс после получения аудио. По внутренним тестам Microsoft, слова появляются в два раза быстрее, чем у ближайшего конкурента.

Поддерживается ли диаризация говорящих?

В доноре это не указано для MAI-Transcribe-2-Streaming. Для сравнения: Muse Voice Transcribe поддерживает 20+ говорящих, а Gemini 3.5 Transcribe Live не поддерживает диаризацию в режиме Live.

Есть ли SLA?

Нет. Модель находится в публичной превью, гарантии доступности не предоставляются.

Источник: marktechpost.com