ITBear旗下自媒体矩阵:

阿里千问语音合成大模型Qwen-Audio-3.0-TTS发布,多语言方言支持且登顶权威榜单

   时间:2026-07-21 03:50:20 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

阿里千问近日正式推出语音合成大模型Qwen-Audio-3.0-TTS,该模型分为面向实时交互的Flash版本和面向高质量生成的Plus版本。其中,Flash版本的首包延时控制在300毫秒级别,能够满足低延迟场景的需求;Plus版本则专注于提升语音合成的整体质量,为用户提供更优质的音频输出。

在国际权威评测平台Artificial Analysis的最新榜单中,Qwen-Audio-3.0-TTS-Plus凭借卓越表现登顶冠军,Elo评分达到1237分。这一成绩体现了该模型在语音合成领域的领先地位,也证明了其在技术实现上的突破性进展。

新模型在功能设计上实现了多项创新。它支持在文本中嵌入结构化标签,例如[gasp]、[giggles]等,能够精准控制语音的语气、情绪和呼吸细节,使合成语音更加自然生动。同时,音频采样率从24KHz提升至48KHz,单次语音合成的时长上限扩展至3分钟,进一步拓展了应用场景。

在语言覆盖方面,该模型展现了强大的多语种能力,支持中文、英语、日语、韩语、德语等16种语言,并兼容广东话、重庆话、东北话、上海话、四川话、云南话等20种中国方言。配套音色库将持续更新,新增指令风格、方言及多语种音色,为用户提供更丰富的选择。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version