阿里千问近日正式推出语音合成大模型Qwen-Audio-3.0-TTS,该模型分为面向实时交互的Flash版本和面向高质量生成的Plus版本。其中,Flash版本的首包延时控制在300毫秒级别,能够满足低延迟场景的需求;Plus版本则专注于提升语音合成的整体质量,为用户提供更优质的音频输出。
在国际权威评测平台Artificial Analysis的最新榜单中,Qwen-Audio-3.0-TTS-Plus凭借卓越表现登顶冠军,Elo评分达到1237分。这一成绩体现了该模型在语音合成领域的领先地位,也证明了其在技术实现上的突破性进展。
新模型在功能设计上实现了多项创新。它支持在文本中嵌入结构化标签,例如[gasp]、[giggles]等,能够精准控制语音的语气、情绪和呼吸细节,使合成语音更加自然生动。同时,音频采样率从24KHz提升至48KHz,单次语音合成的时长上限扩展至3分钟,进一步拓展了应用场景。
在语言覆盖方面,该模型展现了强大的多语种能力,支持中文、英语、日语、韩语、德语等16种语言,并兼容广东话、重庆话、东北话、上海话、四川话、云南话等20种中国方言。配套音色库将持续更新,新增指令风格、方言及多语种音色,为用户提供更丰富的选择。








