Время до первого токена (TTFT) — метрика, по которой команды выбирают инференс-API для голосовых агентов. И именно она их вводит в заблуждение. TTFT показывает, когда началась генерация, но текстовая модель не может заговорить, пока не получит целую фразу. Между этими двумя точками — разница между агентом, который ощущается живым, и тем, которого перебивают.
Этот материал — бенчмарк каждого уровня голосового стека: LLM, распознавание речи (STT), синтез речи (TTS) и сквозные модели «речь-в-речь» (speech-to-speech).
Почему TTFT — правильная точка входа, но не финишная черта
Голосовой агент — это бюджет задержки с языковой моделью внутри. Каждый этап тратит миллисекунды, которые слышит пользователь.
TTFT — интервал между отправкой запроса на инференс и получением первого токена. Для чата TTFT почти полностью описывает ощущаемую скорость. Для голоса это лишь одно из слагаемых.
Причина механическая: TTS-модель не может синтезировать половину слова. Ей нужна целая клауза или предложение, прежде чем она выдаст аудио. LiveKit называет эту метрику временем до первого предложения (time-to-first-sentence, TTFS) и утверждает в своём материале о развёртывании Gemma 4, что именно TTFS ощущают пользователи.
Это даёт две ручки настройки вместо одной: TTFT управляет началом генерации, а токены в секунду — скоростью завершения первого предложения. Провайдер, который выигрывает в одном и проигрывает в другом, не будет ощущаться быстрым.
Бюджет задержки: сколько стоит один голосовой ход
LiveKit разбивает один ход диалога так: STT — примерно 100–200 мс, LLM — 300–500 мс со стримингом, TTS — 100–200 мс, сеть — 50–150 мс по WebRTC. Практическая целевая сквозная задержка — от 700 мс до 1,2 с.
Квиндла Халтман Крамер, соавтор Pipecat, советует целиться в медианную задержку «голос-в-голос» 800 мс, а 1500 мс считает допустимыми для прототипа. Его грубая арифметика делит это на четыре части примерно по 200 мс: транспорт и обработка медиа, STT с определением конца фразы, инференс LLM и TTS.
Более ранняя работа Daily о самом быстром голосовом боте даёт человеческий базовый уровень: типичное время ответа человека в разговоре — около 500 мс. Паузы дольше 800 мс начинают ощущаться неестественными.
Февральский бенчмарк LLM для голосовых агентов от Daily переводит это в прямое требование к LLM: естественный разговор требует задержки «голос-в-голос» менее 1500 мс, что даёт примерно 700 мс бюджета TTFT для текстовой LLM внутри связки «транскрипция → LLM → голос». Эта цифра в 700 мс — ориентир для оценки любого провайдера.
Как читать бенчмарк TTFT, не дав себя обмануть
Пять фактов методологии меняют значение цифр:
- Форма рабочей нагрузки главенствует. Artificial Analysis в марте 2026 года сменила стандартную нагрузку с 1k на 10k входных токенов. Более длинные промпты повышают и TTFT, и скорость вывода. LiveKit утверждает, что это ближе к реальности для голоса: боевые агенты загружают политики, персону, правила эскалации, полученные данные и схемы инструментов.
- Расположение сервера встроено в цифры. Artificial Analysis тестирует из виртуальной машины в зоне us-central1-a Google Cloud и прямо заявляет, что TTFT включает сетевую задержку и может давать преимущество или недостаток провайдерам в зависимости от их расположения.
- Токены рассуждений считаются. В определении Artificial Analysis TTFT для reasoning-модели — это первый токен рассуждений, а не первый токен ответа. Это разные колонки.
- Измеряйте на приёмной стороне. Daily отмечает, что провайдеры иногда указывают TTFT внутри своих инференс-стеков. Daily измеряет от отправки запроса до первого полезного токена, полученного через API.
- Прогоны невоспроизводимы. Daily прямо говорит: TTFT сильно варьируется между прогонами, а провайдеры меняют инференс-стеки, а иногда и веса, не меняя названий моделей.
Уровень 1: LLM, время до первого токена
Цифры ниже — с лидерборда провайдеров API Artificial Analysis, получены 30 августа 2026 года. Колонка «первый чанк» — это TTFT. Нагрузка — 10k входных токенов, одиночный промпт, медиана за 72 часа.
Самая низкая измеренная задержка первого чанка:
| Провайдер | Модель | TTFT | Скорость вывода |
|---|---|---|---|
| Baseten | gpt-oss-120b (high) | 0,23 с | 266 ток/с |
| Baseten | gpt-oss-120b (low) | 0,24 с | 271 ток/с |
| DeepInfra | Nemotron 3 Ultra | 0,28 с | 371 ток/с |
| Cohere | North Mini Code | 0,32 с | 104 ток/с |
| Cohere | Command A+ | 0,40 с | 239 ток/с |
| Baseten | Inkling Small | 0,42 с | 337 ток/с |
| Modular | Gemma 4 31B (NVFP4) | 0,44 с | 243 ток/с |
| Nebius | GLM-5.3-Flash | 0,46 с | 206 ток/с |
| Fireworks | Nemotron 3.5 Lightning | 0,46 с | 501 ток/с |
| Together AI | Kimi K2.7 Code | 0,47 с | 245 ток/с |
| Cerebras | gpt-oss-120b (high) | 0,49 с | 1 697 ток/с |
Ловушка пропускной способности
Производители кремния оптимизируют под другую метрику, чем нужно голосовым агентам. Mercury 2 — самый яркий пример. Это диффузионная языковая модель, генерирующая 770 токенов в секунду, но её первый чанк приходит через 3,07 с — это в четыре раза больше всего бюджета LLM для естественного разговора.
Cerebras и Groq — другой случай. Их TTFT вполне приличный, а пропускная способность исключительная. Для TTFS такое сочетание сильно: предложение завершается почти сразу после первого токена.
Фронтирные и проприетарные эндпоинты
Обратите внимание на одну и ту же модель на разных хостах: GPT-5.6 Luna без рассуждений показывает 0,59 с на Amazon Bedrock и 0,74 с на собственном API OpenAI. Хостинг и маршрутизация важны не меньше весов.
Выброс, измеренный вендором
LiveKit публикует цифры TTFT для собственного продукта инференса. Gemma 4 31B на LiveKit Inference показала 192 мс против 911 мс у Gemini 2.5 Flash, 966 мс у GPT-5.5, 1006 мс у GPT-4.1 и 1876 мс у той же Gemma 4 31B через OpenRouter.
LiveKit прозрачно объясняет механизм: Gemma работает за SGLang со спекулятивным декодированием, а каждый GPU намеренно недогружен, чтобы задержка в очереди оставалась низкой. Тёплый запрос, по их словам, начинает возвращать токены примерно через 100 мс. Оборотная сторона — цена $1,20 за 1 млн выходных токенов.
Тот же пост сообщает TTFS по полным диалогам: 354 мс для Gemma 4 31B на LiveKit, 1034 мс для Gemini 2.5 Flash, 1088 мс для GPT-4.1, 1267 мс для Gemini 3.0 Flash и 1404 мс для GPT-5.5. На IFBench, независимо оценённом Artificial Analysis, Gemma 4 31B набирает 75,6% против 75,9% у GPT-5.5, 43% у GPT-4.1 и 39% у Gemini 2.5 Flash. На τ²-bench GPT-5.5 лидирует с 93,9%, а Gemma 4 31B — с 76,9%.
Уровень 2: распознавание речи и определение конца хода
Для голоса задержка STT — это не скорость транскрипции. Это то, как быстро после того, как пользователь замолчал, пайплайн понимает, что пользователь замолчал.
Artificial Analysis измеряет две вещи в своём стриминговом STT-лидерборде, обе отталкиваясь от конца речи, определённого SileroVAD: время до первого частичного транскрипта и время до финального транскрипта. Индекс AA-WER Streaming основан примерно на 8 часах аудио: AA-AgentTalk 50%, VoxPopuli 25%, Earnings-22 25%.
Заявленные вендорами цифры задержки:
| Модель | Заявление | Тип источника |
|---|---|---|
| Deepgram Flux | ~260 мс p50 определение конца хода по умолчанию | Документация вендора |
| Deepgram Nova-3 | Менее 300 мс стриминговой задержки | Документация вендора |
| AssemblyAI Universal-Streaming | ~300 мс неизменяемая эмиссия слов | Вендор |
| Cartesia Ink-2 | 100 мс задержка транскрипта | Вендор |
| Speechmatics Voice SDK | 0,451 ± 0,022 с от конца речи до финалов | Внутренний инструмент вендора |
Deepgram Flux архитектурно самый интересный: он встраивает определение конца хода прямо в модель распознавания, а не добавляет VAD сверху. Deepgram утверждает, что это может сократить задержку ответа агента на 200–600 мс по сравнению с традиционным пайплайном STT плюс VAD. Модель открывает параметры eot_threshold (0,5–0,9), eager_eot_threshold (0,3–0,9) и событие EagerEndOfTurn, позволяющее запустить LLM раньше.
Эта последняя возможность важнее сырой цифры. Если вы можете начать генерацию по «нетерпеливому» сигналу, вы при удачном предсказании полностью убираете TTFT LLM с критического пути.
AssemblyAI Universal-Streaming переворачивает обычную модель «сначала частичные, потом финалы», выдавая неизменяемые транскрипты. AssemblyAI сообщила о медианной эмиссии слов 307 мс против 516 мс у Deepgram Nova-3 в собственном измерении 2025 года. Документация также рекомендует использовать для голосовых агентов неформатированные транскрипты: форматирование приходит позже и редко меняет поведение LLM.
Заявления о точности здесь спорны и публикуются вендорами. AssemblyAI сообщает об Universal-3.5 Pro Realtime 6,99% WER на открытом бенчмарке Pipecat для голосовых агентов, опережая Google Chirp3 (9,04%), ElevenLabs Scribe v2 (9,76%) и Deepgram Flux (15,58%). Прежде чем считать это установленным фактом, прогоните тесты сами.
LiveKit также документирует упреждающую генерацию, запускающую LLM по частичному транскрипту. Предостережение реально: если ответ придётся перегенерировать после финального транскрипта, вы сожжёте токены и ничего не сэкономите.
Уровень 3: TTS, время до первого аудио
Здесь цифры вендоров сильнее всего расходятся с тем, что испытывают пользователи.
ElevenLabs заявляет, что Flash v2.5 выдаёт примерно 75 мс. Документация аккуратно уточняет: 75 мс — это только время инференса модели. Страница о концепциях задержки идёт дальше: сетевой круговой путь обычно 20–200 мс в зависимости от географии, а большинство аудиоплееров буферизуют перед воспроизведением, причём буферизация 500 мс — обычное дело. Компания также заявляет, что Eleven v3 не предназначена для реального времени, и рекомендует для своей платформы агентов Flash v2.5, Flash v2 или Multilingual v2.
Cartesia заявляет о TTS менее 90 мс и задержке транскрипта 100 мс для Sonic-3.6 и Ink-2. Материал Marktechpost о релизе Sonic-3.6 отметил, что обе цифры — заявленная вендором задержка модели, а не измеренные сквозные круговые пути. Ранее Cartesia заявляла о сквозном времени до первого аудио 82 мс для Sonic 3.5. Sonic работает на моделях пространства состояний, а не на трансформерах; они масштабируются линейно, а не квадратично с длиной последовательности.
По качеству лидерборд Artificial Analysis Provider Voice — это Elo по слепому прослушиванию, получен 30 августа 2026 года:
| Модель | Elo | Цена за 1 млн символов |
|---|---|---|
| Cartesia Sonic 3.6 | 1 288 | $49,00 |
| SpeechifyAI Simba 3.2 | 1 243 | $10,00 |
| Alibaba Qwen-Audio-3.0-TTS-Plus | 1 243 | $27,60 |
| Inworld Realtime TTS-2 Flash (preview) | 1 228 | $10,40 |
| BreezeBlue Breeze TTS 2 (open weights) | 1 220 | $34,00 |
| ElevenLabs v3 Conversational | 1 215 | $50,00 |
| Google Gemini 3.1 Flash TTS | 1 210 | $18,30 |
| ElevenLabs Flash v2.5 | 1 083 | $50,00 |
Разрыв между Sonic 3.6 на 1288 и Flash v2.5 на 1083 — это цена качества, которую платят за низкозадержанный уровень, на котором работает большинство агентов.
Уровень 4: «Речь-в-речь», время до первого аудио
Сквозные модели «речь-в-речь» схлопывают STT, LLM и TTS в один проход. Меньше круговых путей должно означать меньшую задержку.
LiveKit осторожен: модели реального времени не гарантированно быстрее в каждом случае, а хорошо настроенный каскадный пайплайн может быть вполне конкурентоспособным.
Данные подтверждают эту осторожность. С лидерборда speech-to-speech Artificial Analysis, TTFA измерено на Big Bench Audio, получено 30 августа 2026 года:
| Модель | TTFA | Речевые рассуждения | Успех задач | Индекс S2S |
|---|---|---|---|---|
| Deepslate Opal | 0,44 с | 85% | — | — |
| Gemini 2.5 Flash Native Audio Dialog | 0,63 с | 69% | — | — |
| Grok Voice Think Fast 2.0 High | 0,70 с | 97% | 94,7% | 79,0% |
| Grok Voice Fast 1.0 | 0,78 с | 93% | — | — |
| Qwen3.5 Omni Flash Realtime | 0,79 с | 59% | 29,1% | — |
| OpenAI GPT-Realtime-1.5 | 0,81 с | 81% | 85,1% | 70,3% |
| OpenAI GPT Realtime Mini (окт ’25) | 0,81 с | 64% | 79,6% | 56,8% |
| OpenAI GPT-Realtime-2.1 Mini Minimal | 0,85 с | 63% | 76,7% | 52,8% |
| Google Gemini 3.1 Flash Live Minimal | 0,96 с | 71% | 74,6% | 63,9% |
| OpenAI GPT-Realtime-2.1 Minimal | 0,97 с | 87% | 89,4% | 70,3% |
| Amazon Nova 2.0 Sonic (мар 2026) | 1,14 с | 88% | 57,1% | — |
| OpenAI GPT-Realtime-2 (High) | 1,14 с | 97% | 89,8% | 73,6% |
| OpenAI GPT-Realtime-2.1 High | 1,21 с | 96% | 91,5% | 73,9% |
| Google Gemini 3.1 Flash Live High | 2,99 с | 97% | 71,8% | 71,5% |
| OpenAI GPT-Realtime-2.1 Mini High | 4,28 с | 75% | — | — |
Grok Voice Think Fast 2.0 High — выдающийся результат: 0,70 с TTFA с 97% речевых рассуждений и 94,7% успеха задач.
Штраф за усилия рассуждений виден внутри отдельных семейств моделей. Gemini 3.1 Flash Live переходит с 0,96 с до 2,99 с между уровнями Minimal и High. OpenAI GPT-Realtime-2.1 — с 0,97 с до 1,21 с, покупая 2,1 процентного пункта успеха задач.
OpenAI выпустила gpt-realtime-2.1 и gpt-realtime-2.1-mini в начале июля 2026 года и заявила, что улучшенное кэширование сократило p95 задержку как минимум на 25% во всех своих Realtime-моделях. Хвостовая задержка — это то, из-за чего телефонный агент ощущается сломанным, так что это более полезное заявление, чем улучшение медианы.
Разрыв в возможностях
Бенчмарк Daily объясняет, почему большинство боевых агентов всё ещё используют каскадные пайплайны. На тесте aiwf_medium_context GPT Realtime набрал 86,7% против 94,9% у GPT-4.1. Ultravox 0.7, по оценке Daily, стал первой моделью «речь-в-речь», которая хорошо работает в длинных многоходовых разговорах, и у неё открытые веса.
Artificial Analysis также бенчмаркает четыре «каскадные системы по умолчанию» от вендоров — полезный контекст того, что платформы реально поставляют: Deepgram Voice Agent (Nova-3 + GPT-4o Mini + Aura-2), ElevenLabs Agents (Scribe v2 Realtime + Gemini 2.5 Flash + Eleven Flash v2), Cartesia Line (Ink + Gemini 2.5 Flash + Sonic) и Inworld Realtime (Inworld STT 1 + Gemini 2.5 Flash + Inworld TTS 1.5 Mini). Три из четырёх используют Gemini 2.5 Flash — показательный консенсус.
Эталонные бюджеты
Собрано из проверенных компонентных цифр выше. Это плановые оценки, а не измерения работающей системы.
Агрессивный каскадный пайплайн, хостинг в США, колокация:
| Этап | Бюджет |
|---|---|
| Транспорт и медиа (WebRTC) | 50–150 мс |
| STT + конец хода (Flux по умолчанию) | ~260 мс |
| Первый чанк LLM (уровень до 0,5 с) | 230–500 мс |
| Завершение предложения при 250+ ток/с | ~100 мс |
| Первое аудио TTS + сеть | 150–300 мс |
| Итого | ~790 мс – 1,3 с |
Это попадает в цель 800 мс или чуть выше неё, что совпадает с тезисом Квиндлы: 800 мс достижимо, но впритык.
«Речь-в-речь», одна модель:
| Этап | Бюджет |
|---|---|
| Транспорт и медиа | 50–150 мс |
| TTFA модели (минимальный уровень рассуждений) | 700 мс – 1,0 с |
| Итого | ~750 мс – 1,15 с |
Сопоставимо, но с меньшей наблюдаемостью и, по бенчмарку Daily, измеримым разрывом в возможностях вызова инструментов и следования инструкциям.
Что с этим делать
Выбирайте метрику, которой ограничена ваша архитектура. Если ниже по потоку стоит TTS-модель, оптимизируйте TTFS, а не TTFT, — то есть TTFT и токены в секунду вместе.
Колоцируйте до оптимизации моделей. LiveKit оценивает колокацию агента и модели как очень важную, выше выбора модели. Если используете SIP, держите транк географически близко.
Ограничивайте усилия рассуждений явно. Это самый большой единичный рычаг в таблицах выше, и это флаг конфигурации на большинстве современных эндпоинтов.
Закладывайте бюджет на вызовы инструментов. Квиндла отмечает, что любой ход с вызовом инструмента примерно удваивает задержку LLM. LiveKit рекомендует ограничивать max_tool_steps, консолидировать внешние API-вызовы и проигрывать звук размышления, чтобы тишина не была единственной обратной связью для пользователя.
Инструментируйте до настройки. SDK LiveKit Agents открывает e2e_latency, время до первого токена LLM и время до первого байта TTS на каждом ходе. Pipecat предоставляет эквивалент через enable_metrics и наблюдателей. Храните логи вне системы и следите за регрессиями.
Измеряйте p95, а не только p50. Главное улучшение OpenAI в июле 2026 года — снижение хвостовой задержки, потому что именно на ней ломаются голосовые агенты.
Следите за ловушками инфраструктуры. LiveKit документирует, что самостоятельно размещённые агенты на AWS-инстансах burstable-типа вроде t3 или t4g могут столкнуться с серьёзной задержкой и таймаутами определения хода даже при видимо низкой загрузке CPU.
Если вы предпочитаете не тянуть голосовой пайплайн в облако, обратите внимание на локальные ИИ-агенты, которые работают на ноутбуке или телефоне без облачного билла, — для простых сценариев это снимает вопрос сетевой задержки целиком. А для защиты голосового агента от типовых провалов стоит изучить разбор NVIDIA AI Red Team — там разобраны четыре типовых сценария, на которых ломаются агентные системы.
Частые вопросы
Какой самый быстрый инференс-API по TTFT?
По данным Artificial Analysis на нагрузке 10k токенов, самый быстрый измеренный первый чанк — у Baseten, обслуживающего gpt-oss-120b: 0,23 с. Среди фронтирных эндпоинтов лидирует Amazon Bedrock с GPT-5.6 Luna без рассуждений (0,59 с).
Чем TTFT отличается от TTFS?
TTFT — время до первого токена, момент начала генерации. TTFS (time-to-first-sentence) — время до первого полного предложения, которое может озвучить TTS-модель. Для голосовых агентов TTFS лучше предсказывает ощущаемую скорость, потому что синтез речи требует целой фразы.
Почему у Cerebras такая высокая пропускная способность, но не лучший TTFT?
Cerebras достигает 1697 ток/с, но TTFT у неё 0,49 с. Производители чипов оптимизируют под пропускную способность, а не под задержку первого токена. Для TTFS такое сочетание сильное, но для одиночных запросов есть более быстрые по TTFT провайдеры.
Стоит ли доверять заявленным вендорами цифрам задержки?
С осторожностью. ElevenLabs заявляет 75 мс для Flash v2.5, а Cartesia — менее 90 мс для Sonic-3.6, но обе цифры — время инференса модели без учёта сети и буферизации плеера. Реальная сквозная задержка обычно на 200–500 мс больше.
Когда сквозная модель «речь-в-речь» лучше каскадного пайплайна?
Когда приоритет — простота и низкая задержка в простых диалогах. По бенчмарку Daily, на тесте aiwf_medium_context GPT Realtime набрал 86,7% против 94,9% у каскада с GPT-4.1. Для сложных сценариев с вызовом инструментов каскад пока точнее.
Какой бюджет задержки реален для голосового агента?
LiveKit называет практическую цель 700 мс – 1,2 с на ход. Квиндла Крамер советует целиться в 800 мс медианы «голос-в-голос». Человеческий ответ занимает около 500 мс, а паузы дольше 800 мс ощущаются неестественными.
Что делать, если мой агент ощущается медленным?
Сначала проверьте колокацию модели и агента, затем ограничьте усилия рассуждений (reasoning effort) — это самый большой рычаг: Gemini 3.1 Flash Live переходит с 0,96 с до 2,99 с между уровнями Minimal и High. Инструментируйте через e2e_latency в LiveKit или enable_metrics в Pipecat и смотрите p95, а не только медиану.
Одинаковы ли задержки одной модели у разных хостингов?
Нет. GPT-5.6 Luna без рассуждений показывает 0,59 с на Amazon Bedrock и 0,74 с на собственном API OpenAI. Хостинг, маршрутизация и загрузка очереди влияют на TTFT не меньше, чем веса модели.
Что такое упреждающая генерация в STT?
Это запуск LLM по частичному транскрипту, не дожидаясь финального. Deepgram Flux через событие EagerEndOfTurn и LiveKit через preemptive generation позволяют начать генерацию раньше. Риск — перегенерация ответа после финального транскрипта, что сжигает токены.
Сколько стоит низкая задержка TTS?
Качество голоса падает. Cartesia Sonic 3.6 с задержкой менее 90 мс имеет Elo 1288 по слепому прослушиванию, а ElevenLabs Flash v2.5 — 1083. Разрыв в 205 пунктов Elo — это цена, которую платят агенты на низкозадержанном уровне.
Источник: marktechpost.com