NVIDIA NemotronLabs VoiceChat 11B: открытая модель с задержкой 448 мс и вызовом инструментов

NVIDIA представила NemotronLabs VoiceChat 11B — открытую end-to-end модель класса speech-to-speech для полноценного двустороннего (full-duplex) диалога в реальном времени. Вместо связки из ASR, LLM и TTS она выполняет потоковое распознавание и генерацию речи в единой нейросети, что исключает многоэтапную оркестрацию и задержки на стыках API. Измеренная задержка смены реплик составляет 448 мс по бенчмарку Full-Duplex-Bench 1.0.

Модель слушает, пока говорит: пользователь может перебить агента на середине фразы, и тот уступит. Показатель перехвата инициативы (take-over rate) достигает 1.00 при задержке 480 мс. Это также первая открытая full-duplex модель с поддержкой вызова инструментов (tool calling) без остановки диалога: скрипты передаются по отдельному каналу <TOOLCALL>, а оператор может задать «фразы ожидания», которые агент произносит, пока выполняется API-запрос. Подобный подход к интеграции внешних сервисов напоминает архитектуру Pokee-Isaac 28B, где агент взаимодействует с окружением через контекстные вызовы.

Готовность к продакшену: только пилоты

NVIDIA оценивает готовность модели как PARTIAL — она подходит для пилотных проектов, но не для продакшена. Веса и контейнер открыты, лицензия разрешительная, однако сам вендор прямо указывает, что чекпоинт предназначен «только для исследовательских целей». В документации перечислены реальные ограничения:

  • потолок аудиоконтекста — две минуты;
  • после нескольких реплик возможна деградация в невосстановимую «кашу»;
  • после завершения реплики модель может начать бесконтрольно говорить сама с собой;
  • в транскрипции пользователя возможны пропуски слов.

Эти проблемы схожи с типовыми сбоями ИИ-агентов, описанными NVIDIA AI Red Team: самопроизвольное поведение, потеря контекста и некорректная обработка ввода — ключевые риски, требующие модерации и тестирования.

Кому подойдёт и что нужно для запуска

Модель требует один GPU с видеопамятью от 80 ГБ — A100, H100, RTX 6000 Pro или B200 на x86_64 Linux. Это делает её доступной для AI-стартапов, корпоративных R&D-лабораторий, GPU-облаков и университетских речевых групп. Готового хостинг-API или инференс-провайдера сейчас нет, поэтому команды без собственных GPU не смогут её протестировать.

Среди целевых сценариев — контакт-центры, автомобильные ассистенты, заказ в ретейле и на drive-thru, модернизация IVR в телекоме, диалоги NPC в играх и инструменты доступности.

Архитектура: гибрид Mamba/Transformer

Модель собрана из трёх существующих компонентов NVIDIA и одного нового выходного тракта:

  • речевой энкодер Fast Conformer из Nemotron-Speech-Streaming-En-0.6b, который непрерывно обрабатывает входящий поток 16 кГц;
  • LLM-основа Nemotron Nano v2, потребляющая аудиотокены и предсказывающая текстовые;
  • TTS-декодер и кодек NVIDIA, формирующие речь агента с частотой 22.05 кГц;
  • отдельный выходной канал для скриптов вызова инструментов.

На выходе модель даёт аудио агента, его текст и текущую транскрипцию речи пользователя. Обучение велось примерно на 550 тысячах часов аудио на реальных и синтетических корпусах, с опорой на SALM-Duplex и Audio Flamingo 3.

Вызов инструментов без пауз

Tool-вызовы уходят по боковому каналу в виде блока <TOOLCALL>, а ваш код возвращает результат в блоке <TOOL_RESPONSE>. Ключевая особенность — сообщение on-hold: для каждого инструмента оператор задаёт фразу, которую агент произносит в момент генерации текста, запускающего вызов, чтобы диалог не прерывался тишиной, пока выполняется API.

Ограничения явные: NVIDIA рекомендует не более пяти инструментов за сессию, модель не умеет надёжно вызывать несколько инструментов одновременно, и пользователь не может прервать агента во время выполнения инструмента. Системные промпты и ответы инструментов должны быть только в ASCII и пригодны для синтеза речи.

Результаты тестов

По Full-Duplex-Bench 1.0: смена реплик TOR 0.82 при 448 мс, перехват пользователем TOR 1.00 при 480 мс, обработка пауз TOR 0.153 (синтетика) и 0.255 (Candor), где меньше — лучше.

На AU Harness BFCL-v3 (разговорный вызов инструментов): 58.5% простых, 62.5% множественных, 42.5% параллельных, 27.5% параллельно-множественных, 89.6% релевантность, 56.1% в среднем. На Full-Duplex-Bench v3: 82.5% выбор инструмента, 44.2% точность аргументов, 33% pass@1.

NVIDIA сообщает, что модель занимает второе место среди открытых full-duplex моделей на VoiceBench и второе среди открытых на Full-Duplex-Bench 1.0.

Что это значит для российских команд

Для локальных R&D-групп и стартапов это шанс получить современную full-duplex речь без лицензионных ограничений: веса открыты, лицензия разрешительная. Главный барьер — железо: GPU с 80 ГБ памяти под x86_64 Linux. В текущих условиях это существенное вложение, поэтому модель стоит рассматривать как исследовательский полигон, а не готовое решение для продакшена. Отсутствие хостинг-API означает, что для пилота придётся поднимать собственную инфраструктуру.

Частые вопросы

Что такое full-duplex модель?

Это модель, которая слушает и говорит одновременно, без пауз между репликами. Пользователь может перебить агента, и тот уступит, как в живом разговоре.

Чем VoiceChat 11B отличается от классической связки ASR + LLM + TTS?

Вместо трёх отдельных моделей и обмена данными между ними используется одна end-to-end сеть. Это убирает задержки на стыках и упрощает развёртывание.

На каком GPU можно запустить модель?

Нужен один GPU с минимум 80 ГБ VRAM: A100, H100, RTX 6000 Pro или B200. Платформа — x86_64 Linux.

Есть ли готовый API или облачный хостинг?

Нет. NVIDIA не предоставляет хостинг-API, и ни один инференс-провайдер пока не обслуживает модель. Для теста нужен собственный GPU.

Можно ли использовать модель в продакшене?

NVIDIA прямо пишет, что чекпоинт предназначен только для исследований. Известны сбои: деградация речи после нескольких реплик, самопроизвольная болтовня, пропуск слов в транскрипции.

Как работает вызов инструментов?

Модель генерирует блок <TOOLCALL> на отдельном канале, ваш код возвращает результат в <TOOL_RESPONSE>. Пока API выполняется, агент произносит заданную оператором фразу ожидания.

Какие ограничения у вызова инструментов?

Не более пяти инструментов за сессию, без параллельных вызовов, пользователь не может прервать агента во время выполнения. Промпты и ответы — только ASCII и пригодные для TTS.

С какими другими моделями NVIDIA это связано?

В основе лежат компоненты Nemotron-Speech-Streaming-En-0.6b, Nemotron Nano v2 и TTS-декодер NVIDIA. Обучение опиралось на SALM-Duplex и Audio Flamingo 3.

Источник: marktechpost.com