Google выпустила Gemini 3.5 Transcribe — модель распознавания речи для голосовых интерфейсов реального времени и записанного аудио. Поставка идёт не одним, а двумя эндпоинтами: gemini-3.5-transcribe обрабатывает заранее записанные файлы через Interactions API, а gemini-3.5-transcribe-live отвечает за двунаправленный поток через Live API. По замерам Artificial Analysis, средний показатель word error rate (WER) составляет 4,0% в потоковом режиме и 2,6% в не потоковом.
Время до финальной расшифровки улучшилось на 70% по сравнению с Chirp 3, предыдущей моделью компании. Автоматическое определение языка охватывает более 85 языков, включая переключение кодов в середине предложения. Разделение на два эндпоинта — ключевой момент для планирования: у них разные наборы функций, лимиты и цены. Это не единственная свежая модель Google: Gemini 3.7 Flash делает ставку на код, но без открытых весов.
Развёртывание: только API, без открытых весов
Модель доступна исключительно через API. Открытых весов и возможности самостоятельного хостинга нет — это управляемый сервис, а не инфраструктурное решение.
Подходит для компаний любого размера. Индивидуальные разработчики и стартапы могут начать с бесплатного уровня Gemini API через Google AI Studio. Команды среднего размера переходят на платный тариф для повышения лимитов запросов; он также гарантирует, что контент не будет использоваться для улучшения продуктов Google. Регулируемые предприятия подключаются через Gemini Enterprise Agent Platform, которая добавляет выделенную пропускную способность, средства контроля соответствия и скидки за объём. Оба трека — для разработчиков и для предприятий — находятся в публичном предварительном доступе, поэтому к производственным обязательствам стоит относиться соответственно.
Отрасли применения: контакт-центры и CX-платформы, клиническая документация, субтитры и локализация медиа, юридические и страховые интрейки, инструменты для встреч и голосовые средства разработки. Типовые сценарии — голосовые агенты реального времени, живые субтитры, аналитика пост-звонков, расшифровка встреч с атрибуцией спикеров, диктовка и голосовое управление.
Два API — два разных продукта
Live API обеспечивает непрерывную транскрипцию с задержкой менее секунды. Он выдаёт interim_input_transcription для промежуточных результатов, пока человек говорит, а затем input_transcription, когда реплика завершена. Аудио поступает как сырой 16-битный PCM с частотой 16 кГц в моно, фрагментами по 100 мс. Поддерживается автоматическое, гибридное и ручное обнаружение голосовой активности. Эфемерные токены позволяют мобильным и веб-клиентам транслировать аудио без хранения API-ключа.
Ограничения существенные: живые сессии ограничены 10 минутами непрерывного потока, диаризация спикеров не поддерживается, посекундные временные метки тоже.
Interactions API покрывает то, что потоковый режим не умеет: диаризацию спикеров, временные метки начала и конца слов, а также смещение словаря под конкретную предметную область. Список словаря принимает до 1000 терминов, лучшие результаты — при менее 100. Стандартные запросы принимают до одного часа аудио. Лимит падает до 30 минут, если включена диаризация или временные метки.
Режимы verbatim и smart — главное проектное решение
Оба эндпоинта предлагают два режима. verbatim — режим по умолчанию, возвращает всё: слова-паразиты, повторы и ложные старты. smart убирает запинки, исправляет оговорки и применяет структурированное форматирование.
Документированный пример Google:
«Um, so for the meeting, I think we should, uh, invite Alice and, wait no, Bob and Carol.»
Режим verbatim сохраняет всё. Режим smart вернёт: «For the meeting, I think we should invite Bob and Carol».
Режим smart нельзя комбинировать с временными метками слов или диаризацией. Это компромисс, который стоит заложить в архитектуру: читаемое резюме и проверяемая расшифровка — теперь два разных вызова API. Похожий выбор между читаемостью и точностью приходится делать и при извлечении информации из текста — GLiNER2.5 решает её предсказанием границ сущностей.
Производительность и экосистема
По данным Artificial Analysis, средний WER — 4,0% в потоковом режиме и 2,6% в не потоковом. На многоязычном бенчмарке FLEURS, по набору основных языков и локалей, модель показывает 5,50% в потоковом режиме и 5,04% в не потоковом.
Live API уже интегрирован с LiveKit, Pipecat, Agora, Fishjam, Vercel и Vision Agents. На потребительской стороне модель работает в Rambler на Android, приложении Gemini на macOS и Google Antigravity. Chrome указан как «скоро». Если вам нужна не расшифровка, а превращение PDF в Markdown, обратите внимание на Cohere Parse 5 — VLM за $1,50 за 1000 страниц.
Средняя стоимость — около $0,005 за минуту в пакетном режиме и $0,009 за минуту в живом. Открытых весов нет.
Частые вопросы
Какая цена у Gemini 3.5 Transcribe?
Средняя стоимость — около $0,005 за минуту аудио в пакетном режиме (Interactions API) и $0,009 за минуту в живом (Live API). Точные тарифы зависят от выбранного плана Google AI Studio или Enterprise Agent Platform.
Можно ли развернуть модель на собственном сервере?
Нет. Gemini 3.5 Transcribe доступна только через API Google. Открытых весов и пути для самостоятельного хостинга не предусмотрено.
В чём разница между двумя эндпоинтами?
Эндпоинт gemini-3.5-transcribe работает с записанными файлами через Interactions API и поддерживает диаризацию, временные метки и словарь. Эндпоинт gemini-3.5-transcribe-live обрабатывает потоковое аудио через Live API с задержкой менее секунды, но без диаризации и временных меток.
Что такое режим smart и чем он отличается от verbatim?
Режим verbatim возвращает дословную расшифровку со всеми словами-паразитами и повторами. Режим smart убирает запинки, исправляет оговорки и форматирует текст, но его нельзя сочетать с временными метками или диаризацией.
Какие лимиты на длительность аудио?
Живая сессия ограничена 10 минутами непрерывного потока. Для записанных файлов стандартный лимит — один час, но он снижается до 30 минут при включении диаризации или временных меток.
Какие языки поддерживает модель?
Автоматическое определение охватывает более 85 языков и локалей, включая переключение кодов в середине предложения без дополнительной настройки.
С какими инструментами уже есть интеграция?
Live API интегрирован с LiveKit, Pipecat, Agora, Fishjam, Vercel и Vision Agents. На потребительской стороне модель используется в Rambler на Android, приложении Gemini на macOS и Google Antigravity.
Стоит ли мигрировать с Chirp 3?
Время до финальной расшифровки у Gemini 3.5 Transcribe на 70% лучше, чем у Chirp 3, а WER ниже. Если ваши сценарии укладываются в лимиты нового API и не требуют открытых весов, миграция оправдана.
Источник: marktechpost.com