Бенчмарк TTFT для голосовых ИИ-агентов: кто быстрее отвечает

Время до первого токена (TTFT) — метрика, по которой команды выбирают инференс-API для голосовых агентов. И именно она их вводит в заблуждение. TTFT показывает, когда началась генерация, но текстовая модель не может заговорить, пока не получит целую фразу. Между этими двумя точками — разница между агентом, который ощущается живым, и тем, которого перебивают.

Этот материал — бенчмарк каждого уровня голосового стека: LLM, распознавание речи (STT), синтез речи (TTS) и сквозные модели «речь-в-речь» (speech-to-speech).

Почему TTFT — правильная точка входа, но не финишная черта

Голосовой агент — это бюджет задержки с языковой моделью внутри. Каждый этап тратит миллисекунды, которые слышит пользователь.

TTFT — интервал между отправкой запроса на инференс и получением первого токена. Для чата TTFT почти полностью описывает ощущаемую скорость. Для голоса это лишь одно из слагаемых.

Причина механическая: TTS-модель не может синтезировать половину слова. Ей нужна целая клауза или предложение, прежде чем она выдаст аудио. LiveKit называет эту метрику временем до первого предложения (time-to-first-sentence, TTFS) и утверждает в своём материале о развёртывании Gemma 4, что именно TTFS ощущают пользователи.

Это даёт две ручки настройки вместо одной: TTFT управляет началом генерации, а токены в секунду — скоростью завершения первого предложения. Провайдер, который выигрывает в одном и проигрывает в другом, не будет ощущаться быстрым.

Бюджет задержки: сколько стоит один голосовой ход

LiveKit разбивает один ход диалога так: STT — примерно 100–200 мс, LLM — 300–500 мс со стримингом, TTS — 100–200 мс, сеть — 50–150 мс по WebRTC. Практическая целевая сквозная задержка — от 700 мс до 1,2 с.

Квиндла Халтман Крамер, соавтор Pipecat, советует целиться в медианную задержку «голос-в-голос» 800 мс, а 1500 мс считает допустимыми для прототипа. Его грубая арифметика делит это на четыре части примерно по 200 мс: транспорт и обработка медиа, STT с определением конца фразы, инференс LLM и TTS.

Более ранняя работа Daily о самом быстром голосовом боте даёт человеческий базовый уровень: типичное время ответа человека в разговоре — около 500 мс. Паузы дольше 800 мс начинают ощущаться неестественными.

Февральский бенчмарк LLM для голосовых агентов от Daily переводит это в прямое требование к LLM: естественный разговор требует задержки «голос-в-голос» менее 1500 мс, что даёт примерно 700 мс бюджета TTFT для текстовой LLM внутри связки «транскрипция → LLM → голос». Эта цифра в 700 мс — ориентир для оценки любого провайдера.

Как читать бенчмарк TTFT, не дав себя обмануть

Пять фактов методологии меняют значение цифр:

  1. Форма рабочей нагрузки главенствует. Artificial Analysis в марте 2026 года сменила стандартную нагрузку с 1k на 10k входных токенов. Более длинные промпты повышают и TTFT, и скорость вывода. LiveKit утверждает, что это ближе к реальности для голоса: боевые агенты загружают политики, персону, правила эскалации, полученные данные и схемы инструментов.
  2. Расположение сервера встроено в цифры. Artificial Analysis тестирует из виртуальной машины в зоне us-central1-a Google Cloud и прямо заявляет, что TTFT включает сетевую задержку и может давать преимущество или недостаток провайдерам в зависимости от их расположения.
  3. Токены рассуждений считаются. В определении Artificial Analysis TTFT для reasoning-модели — это первый токен рассуждений, а не первый токен ответа. Это разные колонки.
  4. Измеряйте на приёмной стороне. Daily отмечает, что провайдеры иногда указывают TTFT внутри своих инференс-стеков. Daily измеряет от отправки запроса до первого полезного токена, полученного через API.
  5. Прогоны невоспроизводимы. Daily прямо говорит: TTFT сильно варьируется между прогонами, а провайдеры меняют инференс-стеки, а иногда и веса, не меняя названий моделей.

Уровень 1: LLM, время до первого токена

Цифры ниже — с лидерборда провайдеров API Artificial Analysis, получены 30 августа 2026 года. Колонка «первый чанк» — это TTFT. Нагрузка — 10k входных токенов, одиночный промпт, медиана за 72 часа.

Самая низкая измеренная задержка первого чанка:

Провайдер Модель TTFT Скорость вывода
Baseten gpt-oss-120b (high) 0,23 с 266 ток/с
Baseten gpt-oss-120b (low) 0,24 с 271 ток/с
DeepInfra Nemotron 3 Ultra 0,28 с 371 ток/с
Cohere North Mini Code 0,32 с 104 ток/с
Cohere Command A+ 0,40 с 239 ток/с
Baseten Inkling Small 0,42 с 337 ток/с
Modular Gemma 4 31B (NVFP4) 0,44 с 243 ток/с
Nebius GLM-5.3-Flash 0,46 с 206 ток/с
Fireworks Nemotron 3.5 Lightning 0,46 с 501 ток/с
Together AI Kimi K2.7 Code 0,47 с 245 ток/с
Cerebras gpt-oss-120b (high) 0,49 с 1 697 ток/с

Ловушка пропускной способности

Производители кремния оптимизируют под другую метрику, чем нужно голосовым агентам. Mercury 2 — самый яркий пример. Это диффузионная языковая модель, генерирующая 770 токенов в секунду, но её первый чанк приходит через 3,07 с — это в четыре раза больше всего бюджета LLM для естественного разговора.

Cerebras и Groq — другой случай. Их TTFT вполне приличный, а пропускная способность исключительная. Для TTFS такое сочетание сильно: предложение завершается почти сразу после первого токена.

Фронтирные и проприетарные эндпоинты

Обратите внимание на одну и ту же модель на разных хостах: GPT-5.6 Luna без рассуждений показывает 0,59 с на Amazon Bedrock и 0,74 с на собственном API OpenAI. Хостинг и маршрутизация важны не меньше весов.

Выброс, измеренный вендором

LiveKit публикует цифры TTFT для собственного продукта инференса. Gemma 4 31B на LiveKit Inference показала 192 мс против 911 мс у Gemini 2.5 Flash, 966 мс у GPT-5.5, 1006 мс у GPT-4.1 и 1876 мс у той же Gemma 4 31B через OpenRouter.

LiveKit прозрачно объясняет механизм: Gemma работает за SGLang со спекулятивным декодированием, а каждый GPU намеренно недогружен, чтобы задержка в очереди оставалась низкой. Тёплый запрос, по их словам, начинает возвращать токены примерно через 100 мс. Оборотная сторона — цена $1,20 за 1 млн выходных токенов.

Тот же пост сообщает TTFS по полным диалогам: 354 мс для Gemma 4 31B на LiveKit, 1034 мс для Gemini 2.5 Flash, 1088 мс для GPT-4.1, 1267 мс для Gemini 3.0 Flash и 1404 мс для GPT-5.5. На IFBench, независимо оценённом Artificial Analysis, Gemma 4 31B набирает 75,6% против 75,9% у GPT-5.5, 43% у GPT-4.1 и 39% у Gemini 2.5 Flash. На τ²-bench GPT-5.5 лидирует с 93,9%, а Gemma 4 31B — с 76,9%.

Уровень 2: распознавание речи и определение конца хода

Для голоса задержка STT — это не скорость транскрипции. Это то, как быстро после того, как пользователь замолчал, пайплайн понимает, что пользователь замолчал.

Artificial Analysis измеряет две вещи в своём стриминговом STT-лидерборде, обе отталкиваясь от конца речи, определённого SileroVAD: время до первого частичного транскрипта и время до финального транскрипта. Индекс AA-WER Streaming основан примерно на 8 часах аудио: AA-AgentTalk 50%, VoxPopuli 25%, Earnings-22 25%.

Заявленные вендорами цифры задержки:

Модель Заявление Тип источника
Deepgram Flux ~260 мс p50 определение конца хода по умолчанию Документация вендора
Deepgram Nova-3 Менее 300 мс стриминговой задержки Документация вендора
AssemblyAI Universal-Streaming ~300 мс неизменяемая эмиссия слов Вендор
Cartesia Ink-2 100 мс задержка транскрипта Вендор
Speechmatics Voice SDK 0,451 ± 0,022 с от конца речи до финалов Внутренний инструмент вендора

Deepgram Flux архитектурно самый интересный: он встраивает определение конца хода прямо в модель распознавания, а не добавляет VAD сверху. Deepgram утверждает, что это может сократить задержку ответа агента на 200–600 мс по сравнению с традиционным пайплайном STT плюс VAD. Модель открывает параметры eot_threshold (0,5–0,9), eager_eot_threshold (0,3–0,9) и событие EagerEndOfTurn, позволяющее запустить LLM раньше.

Эта последняя возможность важнее сырой цифры. Если вы можете начать генерацию по «нетерпеливому» сигналу, вы при удачном предсказании полностью убираете TTFT LLM с критического пути.

AssemblyAI Universal-Streaming переворачивает обычную модель «сначала частичные, потом финалы», выдавая неизменяемые транскрипты. AssemblyAI сообщила о медианной эмиссии слов 307 мс против 516 мс у Deepgram Nova-3 в собственном измерении 2025 года. Документация также рекомендует использовать для голосовых агентов неформатированные транскрипты: форматирование приходит позже и редко меняет поведение LLM.

Заявления о точности здесь спорны и публикуются вендорами. AssemblyAI сообщает об Universal-3.5 Pro Realtime 6,99% WER на открытом бенчмарке Pipecat для голосовых агентов, опережая Google Chirp3 (9,04%), ElevenLabs Scribe v2 (9,76%) и Deepgram Flux (15,58%). Прежде чем считать это установленным фактом, прогоните тесты сами.

LiveKit также документирует упреждающую генерацию, запускающую LLM по частичному транскрипту. Предостережение реально: если ответ придётся перегенерировать после финального транскрипта, вы сожжёте токены и ничего не сэкономите.

Уровень 3: TTS, время до первого аудио

Здесь цифры вендоров сильнее всего расходятся с тем, что испытывают пользователи.

ElevenLabs заявляет, что Flash v2.5 выдаёт примерно 75 мс. Документация аккуратно уточняет: 75 мс — это только время инференса модели. Страница о концепциях задержки идёт дальше: сетевой круговой путь обычно 20–200 мс в зависимости от географии, а большинство аудиоплееров буферизуют перед воспроизведением, причём буферизация 500 мс — обычное дело. Компания также заявляет, что Eleven v3 не предназначена для реального времени, и рекомендует для своей платформы агентов Flash v2.5, Flash v2 или Multilingual v2.

Cartesia заявляет о TTS менее 90 мс и задержке транскрипта 100 мс для Sonic-3.6 и Ink-2. Материал Marktechpost о релизе Sonic-3.6 отметил, что обе цифры — заявленная вендором задержка модели, а не измеренные сквозные круговые пути. Ранее Cartesia заявляла о сквозном времени до первого аудио 82 мс для Sonic 3.5. Sonic работает на моделях пространства состояний, а не на трансформерах; они масштабируются линейно, а не квадратично с длиной последовательности.

По качеству лидерборд Artificial Analysis Provider Voice — это Elo по слепому прослушиванию, получен 30 августа 2026 года:

Модель Elo Цена за 1 млн символов
Cartesia Sonic 3.6 1 288 $49,00
SpeechifyAI Simba 3.2 1 243 $10,00
Alibaba Qwen-Audio-3.0-TTS-Plus 1 243 $27,60
Inworld Realtime TTS-2 Flash (preview) 1 228 $10,40
BreezeBlue Breeze TTS 2 (open weights) 1 220 $34,00
ElevenLabs v3 Conversational 1 215 $50,00
Google Gemini 3.1 Flash TTS 1 210 $18,30
ElevenLabs Flash v2.5 1 083 $50,00

Разрыв между Sonic 3.6 на 1288 и Flash v2.5 на 1083 — это цена качества, которую платят за низкозадержанный уровень, на котором работает большинство агентов.

Уровень 4: «Речь-в-речь», время до первого аудио

Сквозные модели «речь-в-речь» схлопывают STT, LLM и TTS в один проход. Меньше круговых путей должно означать меньшую задержку.

LiveKit осторожен: модели реального времени не гарантированно быстрее в каждом случае, а хорошо настроенный каскадный пайплайн может быть вполне конкурентоспособным.

Данные подтверждают эту осторожность. С лидерборда speech-to-speech Artificial Analysis, TTFA измерено на Big Bench Audio, получено 30 августа 2026 года:

Модель TTFA Речевые рассуждения Успех задач Индекс S2S
Deepslate Opal 0,44 с 85%
Gemini 2.5 Flash Native Audio Dialog 0,63 с 69%
Grok Voice Think Fast 2.0 High 0,70 с 97% 94,7% 79,0%
Grok Voice Fast 1.0 0,78 с 93%
Qwen3.5 Omni Flash Realtime 0,79 с 59% 29,1%
OpenAI GPT-Realtime-1.5 0,81 с 81% 85,1% 70,3%
OpenAI GPT Realtime Mini (окт ’25) 0,81 с 64% 79,6% 56,8%
OpenAI GPT-Realtime-2.1 Mini Minimal 0,85 с 63% 76,7% 52,8%
Google Gemini 3.1 Flash Live Minimal 0,96 с 71% 74,6% 63,9%
OpenAI GPT-Realtime-2.1 Minimal 0,97 с 87% 89,4% 70,3%
Amazon Nova 2.0 Sonic (мар 2026) 1,14 с 88% 57,1%
OpenAI GPT-Realtime-2 (High) 1,14 с 97% 89,8% 73,6%
OpenAI GPT-Realtime-2.1 High 1,21 с 96% 91,5% 73,9%
Google Gemini 3.1 Flash Live High 2,99 с 97% 71,8% 71,5%
OpenAI GPT-Realtime-2.1 Mini High 4,28 с 75%

Grok Voice Think Fast 2.0 High — выдающийся результат: 0,70 с TTFA с 97% речевых рассуждений и 94,7% успеха задач.

Штраф за усилия рассуждений виден внутри отдельных семейств моделей. Gemini 3.1 Flash Live переходит с 0,96 с до 2,99 с между уровнями Minimal и High. OpenAI GPT-Realtime-2.1 — с 0,97 с до 1,21 с, покупая 2,1 процентного пункта успеха задач.

OpenAI выпустила gpt-realtime-2.1 и gpt-realtime-2.1-mini в начале июля 2026 года и заявила, что улучшенное кэширование сократило p95 задержку как минимум на 25% во всех своих Realtime-моделях. Хвостовая задержка — это то, из-за чего телефонный агент ощущается сломанным, так что это более полезное заявление, чем улучшение медианы.

Разрыв в возможностях

Бенчмарк Daily объясняет, почему большинство боевых агентов всё ещё используют каскадные пайплайны. На тесте aiwf_medium_context GPT Realtime набрал 86,7% против 94,9% у GPT-4.1. Ultravox 0.7, по оценке Daily, стал первой моделью «речь-в-речь», которая хорошо работает в длинных многоходовых разговорах, и у неё открытые веса.

Artificial Analysis также бенчмаркает четыре «каскадные системы по умолчанию» от вендоров — полезный контекст того, что платформы реально поставляют: Deepgram Voice Agent (Nova-3 + GPT-4o Mini + Aura-2), ElevenLabs Agents (Scribe v2 Realtime + Gemini 2.5 Flash + Eleven Flash v2), Cartesia Line (Ink + Gemini 2.5 Flash + Sonic) и Inworld Realtime (Inworld STT 1 + Gemini 2.5 Flash + Inworld TTS 1.5 Mini). Три из четырёх используют Gemini 2.5 Flash — показательный консенсус.

Эталонные бюджеты

Собрано из проверенных компонентных цифр выше. Это плановые оценки, а не измерения работающей системы.

Агрессивный каскадный пайплайн, хостинг в США, колокация:

Этап Бюджет
Транспорт и медиа (WebRTC) 50–150 мс
STT + конец хода (Flux по умолчанию) ~260 мс
Первый чанк LLM (уровень до 0,5 с) 230–500 мс
Завершение предложения при 250+ ток/с ~100 мс
Первое аудио TTS + сеть 150–300 мс
Итого ~790 мс – 1,3 с

Это попадает в цель 800 мс или чуть выше неё, что совпадает с тезисом Квиндлы: 800 мс достижимо, но впритык.

«Речь-в-речь», одна модель:

Этап Бюджет
Транспорт и медиа 50–150 мс
TTFA модели (минимальный уровень рассуждений) 700 мс – 1,0 с
Итого ~750 мс – 1,15 с

Сопоставимо, но с меньшей наблюдаемостью и, по бенчмарку Daily, измеримым разрывом в возможностях вызова инструментов и следования инструкциям.

Что с этим делать

Выбирайте метрику, которой ограничена ваша архитектура. Если ниже по потоку стоит TTS-модель, оптимизируйте TTFS, а не TTFT, — то есть TTFT и токены в секунду вместе.

Колоцируйте до оптимизации моделей. LiveKit оценивает колокацию агента и модели как очень важную, выше выбора модели. Если используете SIP, держите транк географически близко.

Ограничивайте усилия рассуждений явно. Это самый большой единичный рычаг в таблицах выше, и это флаг конфигурации на большинстве современных эндпоинтов.

Закладывайте бюджет на вызовы инструментов. Квиндла отмечает, что любой ход с вызовом инструмента примерно удваивает задержку LLM. LiveKit рекомендует ограничивать max_tool_steps, консолидировать внешние API-вызовы и проигрывать звук размышления, чтобы тишина не была единственной обратной связью для пользователя.

Инструментируйте до настройки. SDK LiveKit Agents открывает e2e_latency, время до первого токена LLM и время до первого байта TTS на каждом ходе. Pipecat предоставляет эквивалент через enable_metrics и наблюдателей. Храните логи вне системы и следите за регрессиями.

Измеряйте p95, а не только p50. Главное улучшение OpenAI в июле 2026 года — снижение хвостовой задержки, потому что именно на ней ломаются голосовые агенты.

Следите за ловушками инфраструктуры. LiveKit документирует, что самостоятельно размещённые агенты на AWS-инстансах burstable-типа вроде t3 или t4g могут столкнуться с серьёзной задержкой и таймаутами определения хода даже при видимо низкой загрузке CPU.

Если вы предпочитаете не тянуть голосовой пайплайн в облако, обратите внимание на локальные ИИ-агенты, которые работают на ноутбуке или телефоне без облачного билла, — для простых сценариев это снимает вопрос сетевой задержки целиком. А для защиты голосового агента от типовых провалов стоит изучить разбор NVIDIA AI Red Team — там разобраны четыре типовых сценария, на которых ломаются агентные системы.

Частые вопросы

Какой самый быстрый инференс-API по TTFT?

По данным Artificial Analysis на нагрузке 10k токенов, самый быстрый измеренный первый чанк — у Baseten, обслуживающего gpt-oss-120b: 0,23 с. Среди фронтирных эндпоинтов лидирует Amazon Bedrock с GPT-5.6 Luna без рассуждений (0,59 с).

Чем TTFT отличается от TTFS?

TTFT — время до первого токена, момент начала генерации. TTFS (time-to-first-sentence) — время до первого полного предложения, которое может озвучить TTS-модель. Для голосовых агентов TTFS лучше предсказывает ощущаемую скорость, потому что синтез речи требует целой фразы.

Почему у Cerebras такая высокая пропускная способность, но не лучший TTFT?

Cerebras достигает 1697 ток/с, но TTFT у неё 0,49 с. Производители чипов оптимизируют под пропускную способность, а не под задержку первого токена. Для TTFS такое сочетание сильное, но для одиночных запросов есть более быстрые по TTFT провайдеры.

Стоит ли доверять заявленным вендорами цифрам задержки?

С осторожностью. ElevenLabs заявляет 75 мс для Flash v2.5, а Cartesia — менее 90 мс для Sonic-3.6, но обе цифры — время инференса модели без учёта сети и буферизации плеера. Реальная сквозная задержка обычно на 200–500 мс больше.

Когда сквозная модель «речь-в-речь» лучше каскадного пайплайна?

Когда приоритет — простота и низкая задержка в простых диалогах. По бенчмарку Daily, на тесте aiwf_medium_context GPT Realtime набрал 86,7% против 94,9% у каскада с GPT-4.1. Для сложных сценариев с вызовом инструментов каскад пока точнее.

Какой бюджет задержки реален для голосового агента?

LiveKit называет практическую цель 700 мс – 1,2 с на ход. Квиндла Крамер советует целиться в 800 мс медианы «голос-в-голос». Человеческий ответ занимает около 500 мс, а паузы дольше 800 мс ощущаются неестественными.

Что делать, если мой агент ощущается медленным?

Сначала проверьте колокацию модели и агента, затем ограничьте усилия рассуждений (reasoning effort) — это самый большой рычаг: Gemini 3.1 Flash Live переходит с 0,96 с до 2,99 с между уровнями Minimal и High. Инструментируйте через e2e_latency в LiveKit или enable_metrics в Pipecat и смотрите p95, а не только медиану.

Одинаковы ли задержки одной модели у разных хостингов?

Нет. GPT-5.6 Luna без рассуждений показывает 0,59 с на Amazon Bedrock и 0,74 с на собственном API OpenAI. Хостинг, маршрутизация и загрузка очереди влияют на TTFT не меньше, чем веса модели.

Что такое упреждающая генерация в STT?

Это запуск LLM по частичному транскрипту, не дожидаясь финального. Deepgram Flux через событие EagerEndOfTurn и LiveKit через preemptive generation позволяют начать генерацию раньше. Риск — перегенерация ответа после финального транскрипта, что сжигает токены.

Сколько стоит низкая задержка TTS?

Качество голоса падает. Cartesia Sonic 3.6 с задержкой менее 90 мс имеет Elo 1288 по слепому прослушиванию, а ElevenLabs Flash v2.5 — 1083. Разрыв в 205 пунктов Elo — это цена, которую платят агенты на низкозадержанном уровне.

Источник: marktechpost.com