Google выпустил две модели синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Первая рассчитана на творческую работу со звуком: интерактивные развлечения, разработку игр и длинные озвучки, где нужна голосовая «режиссура» по текстовому запросу. Вторая — на массовую обработку: автоматический дубляж, разговорные агенты для клиентов и конвейеры перевода с высокой пропускной способностью.
Обе модели продолжают линейку аудиоинструментов Google, в которой уже вышли 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking. Новинки призваны заменить фиксированный каталог из 30 прежних голосов.
Каталог на 2000 голосов и модуль ремикса
Разработчикам доступен каталог из более чем 2000 заранее подготовленных голосовых профилей. Он покрывает региональные варианты — квебекский французский, шотландский английский, мексиканский испанский — и суммарно более 100 языков.
Анонсирован модуль ремикса голоса: звукорежиссёры смогут менять тембр, высоту, темп и акцентные контуры прямыми текстовыми командами.
Результаты в бенчмарках Hume AI
Независимые оценки поставили старшую модель на первое место в сторонних аудиорейтингах. В Hume AI Voice Design Benchmark Gemini 3.8 Flash TTS набрала 71,4 балла в целом и 60,8 — лучший результат в категории моделирования акцента.
В Hume AI Overall Quality Index первое место заняла Gemini 3.8 Flash TTS, второе — Gemini 3.8 Flash-Lite TTS; обе обошли прежние базовые показатели Gemini 3.1 Flash TTS.
Двойные слепые испытания в Voice Arena подтвердили преимущество в предпочтениях для ряда языков: японского, бразильского португальского, вьетнамского, современного стандартного арабского, мексиканского испанского и хинди.
Диалоги, многочасовые файлы и невербальные метки
Отдельный акцент — многоголосые сцены и длинные сессии синтеза. Один сценарий управляет обменом реплик между двумя говорящими: сохраняется естественная смена реплик и разделение голосов на протяжении долгих диалогов.
Качество звука и тембр персонажа остаются стабильными на многочасовых файлах, что снижает деградацию голоса при записи аудиокниг и подкастов. Авторы могут вставлять невербальные метки прямо в текст — например, <laughs>, <sigh> или <gasp>, — а также реактивные вставки вроде |mhm| и |yeah|, чтобы выдерживать разговорный темп.
Клонирование голоса: 30 секунд записи и согласие владельца
Конвейеры клонирования голоса опираются на обязательную проверку личности — это защита от подделки. Для воссоздания голосового профиля нужны 30-секундная эталонная запись и отдельная дорожка с явным устным согласием, произнесённым владельцем голоса. Google сверяет акустическое соответствие обеих дорожек, прежде чем обрабатывать пользовательский профиль.
В сгенерированные звуковые файлы встраиваются незаметные аудиоводяные знаки SynthID и криптографические метаданные происхождения C2PA прямо в экспортируемую звуковую волну. Это позволяет инструментам на стороне получателя распознавать синтетическую речь.
Где уже доступны модели
Развёртывание в корпоративной среде началось сразу в нескольких программных экосистемах. Разработчики получают доступ к Flash TTS и Flash-Lite TTS через Google AI Studio и стандартный API Gemini, а также через фреймворки Agora, LiveKit, Pipecat и Vercel.
Среди ранних коммерческих интеграций — Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang: региональный перевод медиа и автоматизация обслуживания клиентов. Конечные пользователи получают Flash TTS прямо в Gemini Notebook, тогда как Google Vids использует Flash-Lite TTS. Клиентам Gemini Enterprise административный доступ к API обещан в одной из следующих волн развёртывания.
Тем, кто уже работает с моделями Google, стоит учитывать, что Gemini 3.8 Flash и Flash Cyber различаются уровнями доступа, а голосовые агенты на базе Gemini 3.8 Live умеют вызывать инструменты в фоне. Если задача — распознавание речи, а не синтез, отдельная линейка Gemini 3.5 Transcribe решает обратную задачу.
Частые вопросы
Чем Flash TTS отличается от Flash-Lite TTS?
Flash TTS нацелена на творческие задачи — игры, интерактивные развлечения, длинные озвучки с управлением голосом по запросу. Flash-Lite TTS — на массовые сценарии: автоматический дубляж, разговорные агенты и конвейеры перевода.
Сколько языков и голосов доступно?
Каталог содержит более 2000 готовых голосовых профилей и покрывает более 100 языков, включая региональные варианты вроде квебекского французского, шотландского английского и мексиканского испанского.
Как получить доступ к моделям?
Через Google AI Studio и стандартный API Gemini. Также заявлена поддержка фреймворков Agora, LiveKit, Pipecat и Vercel.
Какие оценки модели в бенчмарках?
В Hume AI Voice Design Benchmark Gemini 3.8 Flash TTS набрала 71,4 балла в целом и 60,8 в моделировании акцента. В Hume AI Overall Quality Index она заняла первое место, Flash-Lite TTS — второе.
Как защищены от подделки голоса?
Для клонирования нужны 30-секундная эталонная запись и устное согласие владельца голоса; Google сверяет акустическое соответствие дорожек. В файлы встраиваются водяные знаки SynthID и метаданные C2PA.
Что такое метки вроде <laughs>?
Это невербальные акустические маркеры, которые автор вставляет прямо в текст сценария. Кроме них поддерживаются реактивные вставки |mhm| и |yeah| для разговорного темпа.
Где уже используют новые модели?
Среди ранних интеграций — Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang. Конечным пользователям Flash TTS доступна в Gemini Notebook, а Flash-Lite TTS — в Google Vids.
Подходят ли модели для аудиокниг и подкастов?
Да, заявлена стабильность качества и тембра на многочасовых файлах, что снижает деградацию голоса при длинной записи.
Что было до этих моделей?
Прежний каталог состоял из 30 фиксированных голосов. В аудиолинейке Google также выходили 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking.
Источник: artificialintelligence-news.com