NVIDIA представила NemotronLabs VoiceChat 11B — открытую end-to-end модель класса speech-to-speech для полноценного двустороннего (full-duplex) диалога в реальном времени. Вместо связки из ASR, LLM и TTS она выполняет потоковое распознавание и генерацию речи в единой нейросети, что исключает многоэтапную оркестрацию и задержки на стыках API. Измеренная задержка смены реплик составляет 448 мс по бенчмарку Full-Duplex-Bench 1.0.
Модель слушает, пока говорит: пользователь может перебить агента на середине фразы, и тот уступит. Показатель перехвата инициативы (take-over rate) достигает 1.00 при задержке 480 мс. Это также первая открытая full-duplex модель с поддержкой вызова инструментов (tool calling) без остановки диалога: скрипты передаются по отдельному каналу <TOOLCALL>, а оператор может задать «фразы ожидания», которые агент произносит, пока выполняется API-запрос. Подобный подход к интеграции внешних сервисов напоминает архитектуру Pokee-Isaac 28B, где агент взаимодействует с окружением через контекстные вызовы.
Готовность к продакшену: только пилоты
NVIDIA оценивает готовность модели как PARTIAL — она подходит для пилотных проектов, но не для продакшена. Веса и контейнер открыты, лицензия разрешительная, однако сам вендор прямо указывает, что чекпоинт предназначен «только для исследовательских целей». В документации перечислены реальные ограничения:
- потолок аудиоконтекста — две минуты;
- после нескольких реплик возможна деградация в невосстановимую «кашу»;
- после завершения реплики модель может начать бесконтрольно говорить сама с собой;
- в транскрипции пользователя возможны пропуски слов.
Эти проблемы схожи с типовыми сбоями ИИ-агентов, описанными NVIDIA AI Red Team: самопроизвольное поведение, потеря контекста и некорректная обработка ввода — ключевые риски, требующие модерации и тестирования.
Кому подойдёт и что нужно для запуска
Модель требует один GPU с видеопамятью от 80 ГБ — A100, H100, RTX 6000 Pro или B200 на x86_64 Linux. Это делает её доступной для AI-стартапов, корпоративных R&D-лабораторий, GPU-облаков и университетских речевых групп. Готового хостинг-API или инференс-провайдера сейчас нет, поэтому команды без собственных GPU не смогут её протестировать.
Среди целевых сценариев — контакт-центры, автомобильные ассистенты, заказ в ретейле и на drive-thru, модернизация IVR в телекоме, диалоги NPC в играх и инструменты доступности.
Архитектура: гибрид Mamba/Transformer
Модель собрана из трёх существующих компонентов NVIDIA и одного нового выходного тракта:
- речевой энкодер Fast Conformer из Nemotron-Speech-Streaming-En-0.6b, который непрерывно обрабатывает входящий поток 16 кГц;
- LLM-основа Nemotron Nano v2, потребляющая аудиотокены и предсказывающая текстовые;
- TTS-декодер и кодек NVIDIA, формирующие речь агента с частотой 22.05 кГц;
- отдельный выходной канал для скриптов вызова инструментов.
На выходе модель даёт аудио агента, его текст и текущую транскрипцию речи пользователя. Обучение велось примерно на 550 тысячах часов аудио на реальных и синтетических корпусах, с опорой на SALM-Duplex и Audio Flamingo 3.
Вызов инструментов без пауз
Tool-вызовы уходят по боковому каналу в виде блока <TOOLCALL>, а ваш код возвращает результат в блоке <TOOL_RESPONSE>. Ключевая особенность — сообщение on-hold: для каждого инструмента оператор задаёт фразу, которую агент произносит в момент генерации текста, запускающего вызов, чтобы диалог не прерывался тишиной, пока выполняется API.
Ограничения явные: NVIDIA рекомендует не более пяти инструментов за сессию, модель не умеет надёжно вызывать несколько инструментов одновременно, и пользователь не может прервать агента во время выполнения инструмента. Системные промпты и ответы инструментов должны быть только в ASCII и пригодны для синтеза речи.
Результаты тестов
По Full-Duplex-Bench 1.0: смена реплик TOR 0.82 при 448 мс, перехват пользователем TOR 1.00 при 480 мс, обработка пауз TOR 0.153 (синтетика) и 0.255 (Candor), где меньше — лучше.
На AU Harness BFCL-v3 (разговорный вызов инструментов): 58.5% простых, 62.5% множественных, 42.5% параллельных, 27.5% параллельно-множественных, 89.6% релевантность, 56.1% в среднем. На Full-Duplex-Bench v3: 82.5% выбор инструмента, 44.2% точность аргументов, 33% pass@1.
NVIDIA сообщает, что модель занимает второе место среди открытых full-duplex моделей на VoiceBench и второе среди открытых на Full-Duplex-Bench 1.0.
Что это значит для российских команд
Для локальных R&D-групп и стартапов это шанс получить современную full-duplex речь без лицензионных ограничений: веса открыты, лицензия разрешительная. Главный барьер — железо: GPU с 80 ГБ памяти под x86_64 Linux. В текущих условиях это существенное вложение, поэтому модель стоит рассматривать как исследовательский полигон, а не готовое решение для продакшена. Отсутствие хостинг-API означает, что для пилота придётся поднимать собственную инфраструктуру.
Частые вопросы
Что такое full-duplex модель?
Это модель, которая слушает и говорит одновременно, без пауз между репликами. Пользователь может перебить агента, и тот уступит, как в живом разговоре.
Чем VoiceChat 11B отличается от классической связки ASR + LLM + TTS?
Вместо трёх отдельных моделей и обмена данными между ними используется одна end-to-end сеть. Это убирает задержки на стыках и упрощает развёртывание.
На каком GPU можно запустить модель?
Нужен один GPU с минимум 80 ГБ VRAM: A100, H100, RTX 6000 Pro или B200. Платформа — x86_64 Linux.
Есть ли готовый API или облачный хостинг?
Нет. NVIDIA не предоставляет хостинг-API, и ни один инференс-провайдер пока не обслуживает модель. Для теста нужен собственный GPU.
Можно ли использовать модель в продакшене?
NVIDIA прямо пишет, что чекпоинт предназначен только для исследований. Известны сбои: деградация речи после нескольких реплик, самопроизвольная болтовня, пропуск слов в транскрипции.
Как работает вызов инструментов?
Модель генерирует блок <TOOLCALL> на отдельном канале, ваш код возвращает результат в <TOOL_RESPONSE>. Пока API выполняется, агент произносит заданную оператором фразу ожидания.
Какие ограничения у вызова инструментов?
Не более пяти инструментов за сессию, без параллельных вызовов, пользователь не может прервать агента во время выполнения. Промпты и ответы — только ASCII и пригодные для TTS.
С какими другими моделями NVIDIA это связано?
В основе лежат компоненты Nemotron-Speech-Streaming-En-0.6b, Nemotron Nano v2 и TTS-декодер NVIDIA. Обучение опиралось на SALM-Duplex и Audio Flamingo 3.
Источник: marktechpost.com