Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — свои самые продвинутые на сегодня модели живого диалога. Обе работают по схеме «речь в речь» и рассчитаны на голосовых агентов реального времени. Это продолжение семейства Gemini Audio, которое Google расширила в прошлом месяце моделью Gemini 3.5 Transcribe с распознаванием речи при WER 2,6%.
Новинки закрывают конкретный пробел: голосовые агенты, которые умеют рассуждать и выполнять инструментальные вызовы, не разрывая разговор. Обе модели уже доступны в Gemini Live API и Google AI Studio. Это хостинговые модели, а не открытые веса, поэтому варианта с самостоятельным развёртыванием нет.
Две модели с разными ролями
Gemini 3.8 Live рассчитана на масштаб и экономичность: разговорный интеллект плюс плавный диалог и визуальная привязка к контексту.
Gemini 3.8 Live Extended Thinking нацелена на задачи высокой сложности. Она добавляет больше интеллекта и многошаговые рассуждения прямо во время речи. Google позиционирует обе модели как упрощённую альтернативу каскадным речевым конвейерам, где последовательно соединяются ASR, LLM и TTS.
Результаты бенчмарков
Gemini 3.8 Live Extended Thinking заняла первое место в общем зачёте Speech to Speech Quality Index от Artificial Analysis со score 82,6. Она лидирует по завершению агентных задач: 68,6% на τ-Voice и 35,1% на τ-Voice-banking от Sierra. На Big Bench Audio, бенчмарке рассуждений для аудиомоделей, результат — 97,7%. Gemini 3.8 Live заняла второе место в Speech Agent Arena, оценке человеческих предпочтений. По данным Google, на EVA-Bench от ServiceNow модели сдвигают границу Парето для сложных рабочих процессов: баланс точности задач и качества диалога измерялся на Live API в Gemini Enterprise Agent Platform.
Пять возможностей Live API
Для разработчиков Live API открывает в новых моделях пять ключевых возможностей.
- Асинхронный вызов функций. Модель выполняет вызовы API и инструментов в фоне. Аудиоответ продолжает поступать пользователю, пока задачи завершаются.
- Визуальный контекст. Модель обрабатывает живые визуальные входы почти в реальном времени, поэтому агент понимает, что пользователь говорит и видит.
- Точность букв и цифр. Модель корректно разбирает коды подтверждения, номера заявок и технические данные — типичное слабое место голосовых систем.
- Многоязычность. Она автоматически определяет и переключает 97 поддерживаемых языков прямо посреди разговора, сохраняя единообразие акцента.
- Инкрементальные обновления контента. Модель объединяет аудио реального времени со структурированными данными и возвращает ответы с учётом контекста.
Extended Thinking добавляет настраиваемое мышление для многошаговых рассуждений в фоне. Модель рассуждает и говорит одновременно: сначала подаёт ранние словесные сигналы вроде «Сейчас проверю», подтверждая запрос, а затем пошагово комментирует прогресс, пока выполняются длительные задачи. В демонстрациях Google модель превращает наброски вместе с голосовой обратной связью в рабочие компоненты React и координирует многошаговые бронирования.
Цены и экосистема
Обе модели стоят $0,005/мин за аудиовход и $0,018/мин за аудиовыход. Google уточняет, что оценка основана на $3 за 1 млн входных токенов и $12 за 1 млн выходных.
Разработчики могут строить решения через интеграционных партнёров Live API, которые берут на себя инфраструктуру потоковой передачи медиа в реальном времени: Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Google также партнёрствует с Salesforce, Genspark и Lumeris — те отмечают задержку, плавность и вызов инструментов у новых моделей. Примеры приложений доступны на GitHub.
Весь сгенерированный звук несёт незаметный водяной знак SynthID от Google DeepMind.
Что это значит для команд, делающих голосовых ботов
Главный практический сдвиг — отказ от каскада ASR → LLM → TTS в пользу одной модели «речь в речь». Это убирает накопление задержек на стыках и позволяет агенту продолжать говорить, пока в фоне выполняются вызовы инструментов. Для сценариев вроде банковской поддержки или оформления заказов важна и заявленная точность на буквенно-цифровых данных: коды подтверждения и номера заявок — то, на чём каскадные системы ошибаются чаще всего.
Ограничение тоже существенное: модели хостинговые, открытых весов нет, поэтому развернуть их в закрытом контуре не получится. Тем, кому нужен локальный инференс, придётся смотреть в сторону других решений — например, маршрутизатора локального инференса NVIDIA PAIR, который распределяет нагрузку между RTX, DGX Spark и Mac.
Частые вопросы
Кого касается этот релиз?
Команд, которые делают голосовых агентов или голосовые интерфейсы для поддержки, продаж и внутренних сервисов. Модели доступны через Gemini Live API и Google AI Studio, то есть ориентированы на разработчиков, а не на конечных пользователей.
В чём разница между Gemini 3.8 Live и Live Extended Thinking?
Live рассчитана на масштаб и экономичность, Extended Thinking — на сложные задачи с многошаговыми рассуждениями во время речи. Первая дешевле по назначению, вторая добавляет настраиваемое мышление в фоне.
Сколько стоит использование?
$0,005 за минуту аудиовхода и $0,018 за минуту аудиовыхода. Google поясняет, что расчёт исходит из $3 за 1 млн входных токенов и $12 за 1 млн выходных.
Можно ли развернуть модели на своих серверах?
Нет. Это хостинговые модели без открытых весов, самостоятельного варианта развёртывания не предусмотрено.
Какие языки поддерживаются?
97 языков. Модель автоматически определяет язык и переключается между ними прямо в ходе разговора, сохраняя единообразие акцента.
Что такое фоновый вызов инструментов?
Модель выполняет вызовы API и инструментов асинхронно, не прерывая разговор: аудиоответ продолжает идти пользователю, пока задачи завершаются в фоне.
Как проверить качество модели на своём сценарии?
Ориентироваться на бенчмарки: 82,6 в Speech to Speech Quality Index, 68,6% на τ-Voice, 35,1% на τ-Voice-banking и 97,7% на Big Bench Audio. Но собственный сценарий всё равно стоит прогнать через Live API — метрики не заменяют проверку на реальных данных.
Есть ли водяной знак на сгенерированном аудио?
Да, весь сгенерированный звук несёт незаметный водяной знак SynthID от Google DeepMind.
Какие есть готовые интеграции?
Среди партнёров по интеграции Live API — Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents; они берут на себя инфраструктуру потоковой передачи медиа. Примеры приложений Google выложила на GitHub.
Источник: marktechpost.com