Лаборатория Tongyi Lab от Alibaba выпустила Qwen-Audio-3.0-TTS — систему синтеза речи промышленного уровня. Доступна она только как облачный API через Alibaba Cloud Model Studio и поставляется в двух вариантах с общей архитектурой.
Flash и Plus
- Flash заточен под реальное время: задержка первого пакета на уровне 300 мс — то, что нужно для диалоговых сценариев.
- Plus ставит во главу угла качество: естественность и достоверность голоса важнее скорости. Именно Plus занимает первое место в рейтинге TTS от Artificial Analysis с Elo около 1236.
По ошибкам распознавания (WER/CER) Flash в среднем 3,87, Plus — 3,96. По схожести голоса лидирует Plus — 82,75 в среднем, у Flash — 80,44.
Языки
Модель понимает 16 языков: арабский, китайский, английский, французский, немецкий, индонезийский, итальянский, японский, корейский, малайский, португальский, русский, испанский, тагальский, тайский и вьетнамский, плюс 20 регионов китайских диалектов. Семь языков добавлены по сравнению с прошлыми версиями.
Что под капотом
В основе — низкочастотный речевой токенизатор на 12,5 Гц, который снижает задержку вывода, сохраняя содержание и характеристики голоса, и пятистадийная схема обучения, координирующая языковую модель и flow-matching-компоненты через раздельное предобучение, совместное обучение, обучение с подкреплением и стадию устойчивости. Возможности: синтез до 3 минут за один проход, нормализация сложного текста и вокодер с выходом 48 кГц.
Управление голосом
Стиль задаётся двумя способами: свободными инструкциями на естественном языке и 86 встроенными тегами для точечного управления на уровне слов и фраз — эмоции вроде [excited] или [sad] и звуковые эффекты [laughing], [gasp]. Важная оговорка: теги эмоций и эффектов работают только в однонаправленном потоковом режиме.
Цена и оговорки
Стоимость — 27,59 долл. за 1 млн символов, примерно втрое дешевле сопоставимых предложений ElevenLabs и MiniMax. Но есть слабое место — пропускная способность: Plus выдаёт около 16 символов в секунду, заметно ниже конкурентов Simba 3.2 (30,2), Gemini 3.1 Flash TTS (27) и Sonic 3.5 (120). API работает через двунаправленный WebSocket-стриминг с форматами PCM, WAV, MP3 и Opus; есть SDK DashScope и примеры на Python, Java, Go, C#, PHP и Node.js в регионах Сингапура и Пекина. В сообществе хвалят конкурентную цену и лидерство вне западных решений, но настораживают доступность только в облаке, скромная скорость и путаница в названиях с отдельной линейкой Qwen3-TTS с открытыми весами (Apache 2.0).