在语音技术领域的激烈竞争中,又有一家大模型厂商推出了创新产品。近日,千问团队正式对外发布了其最新研发的语音合成大模型Qwen-Audio-3.0-TTS,这一成果标志着语音合成技术向更加智能化、便捷化的方向迈出了重要一步。
Qwen-Audio-3.0-TTS的最大亮点在于其引入了Free-style自然语言指令控制系统。以往,用户若想让AI以特定语气、节奏或风格进行语音合成,往往需要深入后台,对一系列复杂的工程参数进行精细调整。而现在,这一繁琐过程被大大简化,用户只需用日常语言描述期望的效果,模型便能精准捕捉指令,并生成符合要求的语音,极大地降低了技术门槛。
为了满足不同场景下的多样化需求,千问团队还为Qwen-Audio-3.0-TTS设计了两个版本。其中,Flash版本专为实时交互场景打造,其首包延迟被压缩至300毫秒级别,几乎实现了无感知的语音响应,非常适合实时问答、语音助手等对延迟要求极高的应用。而Plus版本则聚焦于高质量语音生成,致力于提升音质与表现力,为有声书、配音、内容创作等领域提供了更为细腻、生动的语音解决方案。
随着自然语言指令控制技术的引入,千问此次发布的语音合成大模型不仅展现了强大的技术实力,更将语音合成技术从专业工程师的专属领域,拓展到了普通用户也能轻松驾驭的工具范畴。这一变革无疑将推动语音技术在更广泛领域的应用与发展。











