Alibaba выпустила Qwen-Audio-3.0-TTS: облачный синтез речи на 16 языков в тарифах Flash и Plus

Лаборатория Tongyi Lab от Alibaba выпустила Qwen-Audio-3.0-TTS — систему синтеза речи промышленного уровня. Доступна она только как облачный API через Alibaba Cloud Model Studio и поставляется в двух вариантах с общей архитектурой.

Flash и Plus

  • Flash заточен под реальное время: задержка первого пакета на уровне 300 мс — то, что нужно для диалоговых сценариев.
  • Plus ставит во главу угла качество: естественность и достоверность голоса важнее скорости. Именно Plus занимает первое место в рейтинге TTS от Artificial Analysis с Elo около 1236.

По ошибкам распознавания (WER/CER) Flash в среднем 3,87, Plus — 3,96. По схожести голоса лидирует Plus — 82,75 в среднем, у Flash — 80,44.

Языки

Модель понимает 16 языков: арабский, китайский, английский, французский, немецкий, индонезийский, итальянский, японский, корейский, малайский, португальский, русский, испанский, тагальский, тайский и вьетнамский, плюс 20 регионов китайских диалектов. Семь языков добавлены по сравнению с прошлыми версиями.

Что под капотом

В основе — низкочастотный речевой токенизатор на 12,5 Гц, который снижает задержку вывода, сохраняя содержание и характеристики голоса, и пятистадийная схема обучения, координирующая языковую модель и flow-matching-компоненты через раздельное предобучение, совместное обучение, обучение с подкреплением и стадию устойчивости. Возможности: синтез до 3 минут за один проход, нормализация сложного текста и вокодер с выходом 48 кГц.

Управление голосом

Стиль задаётся двумя способами: свободными инструкциями на естественном языке и 86 встроенными тегами для точечного управления на уровне слов и фраз — эмоции вроде [excited] или [sad] и звуковые эффекты [laughing], [gasp]. Важная оговорка: теги эмоций и эффектов работают только в однонаправленном потоковом режиме.

Цена и оговорки

Стоимость — 27,59 долл. за 1 млн символов, примерно втрое дешевле сопоставимых предложений ElevenLabs и MiniMax. Но есть слабое место — пропускная способность: Plus выдаёт около 16 символов в секунду, заметно ниже конкурентов Simba 3.2 (30,2), Gemini 3.1 Flash TTS (27) и Sonic 3.5 (120). API работает через двунаправленный WebSocket-стриминг с форматами PCM, WAV, MP3 и Opus; есть SDK DashScope и примеры на Python, Java, Go, C#, PHP и Node.js в регионах Сингапура и Пекина. В сообществе хвалят конкурентную цену и лидерство вне западных решений, но настораживают доступность только в облаке, скромная скорость и путаница в названиях с отдельной линейкой Qwen3-TTS с открытыми весами (Apache 2.0).