千问大模型近日正式推出语音合成大模型Qwen-Audio-3.0-TTS,包含面向实时交互的Flash版本和面向高质量合成的Plus版本。该模型在细粒度控制、多语种覆盖、方言支持及复杂声学环境适应性等方面实现系统性突破,其中Plus版本在第三方评测机构Artificial Analysis的Speech Arena榜单中以1237的Elo得分登顶全球第一。
在情感表达控制层面,新模型引入结构化标签与自然语言指令双轨机制。用户既可在文本中插入[angry](愤怒)、[giggles](轻笑)等标签精准调控特定位置的语气变化,也能通过"屏住呼吸营造紧张感"等自然语言描述实现整体风格塑造。测试案例显示,添加愤怒标签后,模型合成的飞船事故质问语音中,质问强度随台词推进逐步增强,呼吸节奏与情绪波动高度契合。
多语种能力方面,模型支持中文、英语、日语等16种语言,新增阿拉伯语、越南语等4种语言覆盖。在CV3-eval评测中,其词错误率在10种语言测试中位列榜首,韩语与马来语优势显著。说话人相似度评测显示,Plus版本包揽全部16项最优成绩,Flash版本在15项中位居次席,马来语、西班牙语等语种提升尤为明显。
针对中文方言需求,模型构建了包含广东话、重庆话、上海话等20种方言的语音库。通过强化韵律训练与声调建模,模型在口语表达流畅度上接近母语者水平。用户输入"用四川话讲述"等指令后,模型可自动切换方言模式,合成语音的方言特征保持度较前代提升40%。
在复杂声学环境适应性上,模型创新采用真实场景仿真训练技术。当参考音频存在明显背景噪声或混响时,系统可分离环境干扰与目标音色,实现高保真声音复刻。测试表明,在60分贝环境噪音下,模型仍能提取说话人特征并生成清晰语音,错误率较传统方法降低28%。
技术规格方面,模型将音频采样率从24kHz提升至48kHz,单次合成时长扩展至3分钟,支持开发者直接调用指令风格音色、20种方言音色及14种小语种音色库。目前,Plus与Flash版本均已在阿里云平台开放服务,可为有声读物、影视配音、智能客服等领域提供定制化语音解决方案。













