Gemini 3.8 Flash TTS: Google выпустил две голосовые модели

Google выпустил две модели синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Первая рассчитана на творческую работу со звуком: интерактивные развлечения, разработку игр и длинные озвучки, где нужна голосовая «режиссура» по текстовому запросу. Вторая — на массовую обработку: автоматический дубляж, разговорные агенты для клиентов и конвейеры перевода с высокой пропускной способностью.

Обе модели продолжают линейку аудиоинструментов Google, в которой уже вышли 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking. Новинки призваны заменить фиксированный каталог из 30 прежних голосов.

Каталог на 2000 голосов и модуль ремикса

Разработчикам доступен каталог из более чем 2000 заранее подготовленных голосовых профилей. Он покрывает региональные варианты — квебекский французский, шотландский английский, мексиканский испанский — и суммарно более 100 языков.

Анонсирован модуль ремикса голоса: звукорежиссёры смогут менять тембр, высоту, темп и акцентные контуры прямыми текстовыми командами.

Результаты в бенчмарках Hume AI

Независимые оценки поставили старшую модель на первое место в сторонних аудиорейтингах. В Hume AI Voice Design Benchmark Gemini 3.8 Flash TTS набрала 71,4 балла в целом и 60,8 — лучший результат в категории моделирования акцента.

В Hume AI Overall Quality Index первое место заняла Gemini 3.8 Flash TTS, второе — Gemini 3.8 Flash-Lite TTS; обе обошли прежние базовые показатели Gemini 3.1 Flash TTS.

Двойные слепые испытания в Voice Arena подтвердили преимущество в предпочтениях для ряда языков: японского, бразильского португальского, вьетнамского, современного стандартного арабского, мексиканского испанского и хинди.

Диалоги, многочасовые файлы и невербальные метки

Отдельный акцент — многоголосые сцены и длинные сессии синтеза. Один сценарий управляет обменом реплик между двумя говорящими: сохраняется естественная смена реплик и разделение голосов на протяжении долгих диалогов.

Качество звука и тембр персонажа остаются стабильными на многочасовых файлах, что снижает деградацию голоса при записи аудиокниг и подкастов. Авторы могут вставлять невербальные метки прямо в текст — например, <laughs>, <sigh> или <gasp>, — а также реактивные вставки вроде |mhm| и |yeah|, чтобы выдерживать разговорный темп.

Клонирование голоса: 30 секунд записи и согласие владельца

Конвейеры клонирования голоса опираются на обязательную проверку личности — это защита от подделки. Для воссоздания голосового профиля нужны 30-секундная эталонная запись и отдельная дорожка с явным устным согласием, произнесённым владельцем голоса. Google сверяет акустическое соответствие обеих дорожек, прежде чем обрабатывать пользовательский профиль.

В сгенерированные звуковые файлы встраиваются незаметные аудиоводяные знаки SynthID и криптографические метаданные происхождения C2PA прямо в экспортируемую звуковую волну. Это позволяет инструментам на стороне получателя распознавать синтетическую речь.

Где уже доступны модели

Развёртывание в корпоративной среде началось сразу в нескольких программных экосистемах. Разработчики получают доступ к Flash TTS и Flash-Lite TTS через Google AI Studio и стандартный API Gemini, а также через фреймворки Agora, LiveKit, Pipecat и Vercel.

Среди ранних коммерческих интеграций — Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang: региональный перевод медиа и автоматизация обслуживания клиентов. Конечные пользователи получают Flash TTS прямо в Gemini Notebook, тогда как Google Vids использует Flash-Lite TTS. Клиентам Gemini Enterprise административный доступ к API обещан в одной из следующих волн развёртывания.

Тем, кто уже работает с моделями Google, стоит учитывать, что Gemini 3.8 Flash и Flash Cyber различаются уровнями доступа, а голосовые агенты на базе Gemini 3.8 Live умеют вызывать инструменты в фоне. Если задача — распознавание речи, а не синтез, отдельная линейка Gemini 3.5 Transcribe решает обратную задачу.

Частые вопросы

Чем Flash TTS отличается от Flash-Lite TTS?

Flash TTS нацелена на творческие задачи — игры, интерактивные развлечения, длинные озвучки с управлением голосом по запросу. Flash-Lite TTS — на массовые сценарии: автоматический дубляж, разговорные агенты и конвейеры перевода.

Сколько языков и голосов доступно?

Каталог содержит более 2000 готовых голосовых профилей и покрывает более 100 языков, включая региональные варианты вроде квебекского французского, шотландского английского и мексиканского испанского.

Как получить доступ к моделям?

Через Google AI Studio и стандартный API Gemini. Также заявлена поддержка фреймворков Agora, LiveKit, Pipecat и Vercel.

Какие оценки модели в бенчмарках?

В Hume AI Voice Design Benchmark Gemini 3.8 Flash TTS набрала 71,4 балла в целом и 60,8 в моделировании акцента. В Hume AI Overall Quality Index она заняла первое место, Flash-Lite TTS — второе.

Как защищены от подделки голоса?

Для клонирования нужны 30-секундная эталонная запись и устное согласие владельца голоса; Google сверяет акустическое соответствие дорожек. В файлы встраиваются водяные знаки SynthID и метаданные C2PA.

Что такое метки вроде <laughs>?

Это невербальные акустические маркеры, которые автор вставляет прямо в текст сценария. Кроме них поддерживаются реактивные вставки |mhm| и |yeah| для разговорного темпа.

Где уже используют новые модели?

Среди ранних интеграций — Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang. Конечным пользователям Flash TTS доступна в Gemini Notebook, а Flash-Lite TTS — в Google Vids.

Подходят ли модели для аудиокниг и подкастов?

Да, заявлена стабильность качества и тембра на многочасовых файлах, что снижает деградацию голоса при длинной записи.

Что было до этих моделей?

Прежний каталог состоял из 30 фиксированных голосов. В аудиолинейке Google также выходили 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking.

Источник: artificialintelligence-news.com