ITBear旗下自媒体矩阵:

千问语音合成新突破:自然语言指令操控,实时与高质量双版本并行

   时间:2026-07-21 13:50:33 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在语音技术领域的激烈竞争中,又有一家大模型厂商推出了创新产品。近日,千问团队正式对外发布了其最新研发的语音合成大模型Qwen-Audio-3.0-TTS,这一成果标志着语音合成技术向更加智能化、便捷化的方向迈出了重要一步。

Qwen-Audio-3.0-TTS的最大亮点在于其引入了Free-style自然语言指令控制系统。以往,用户若想让AI以特定语气、节奏或风格进行语音合成,往往需要深入后台,对一系列复杂的工程参数进行精细调整。而现在,这一繁琐过程被大大简化,用户只需用日常语言描述期望的效果,模型便能精准捕捉指令,并生成符合要求的语音,极大地降低了技术门槛。

为了满足不同场景下的多样化需求,千问团队还为Qwen-Audio-3.0-TTS设计了两个版本。其中,Flash版本专为实时交互场景打造,其首包延迟被压缩至300毫秒级别,几乎实现了无感知的语音响应,非常适合实时问答、语音助手等对延迟要求极高的应用。而Plus版本则聚焦于高质量语音生成,致力于提升音质与表现力,为有声书、配音、内容创作等领域提供了更为细腻、生动的语音解决方案。

随着自然语言指令控制技术的引入,千问此次发布的语音合成大模型不仅展现了强大的技术实力,更将语音合成技术从专业工程师的专属领域,拓展到了普通用户也能轻松驾驭的工具范畴。这一变革无疑将推动语音技术在更广泛领域的应用与发展。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version