ITBear旗下自媒体矩阵:

阶跃星辰StepAudio 3系列语音大模型亮相,多领域表现卓越登顶全球榜单

   时间:2026-09-15 17:47:52 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

阶跃星辰近日正式推出StepAudio 3系列语音大模型,涵盖实时对话、语音识别、语音合成、音频生成及音乐创作五大核心场景。该系列包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型,其中多款产品在Artificial Analysis国际评测榜单中登顶全球榜首。

作为实时交互领域的突破性成果,StepAudio 3 Realtime实现了原生全双工对话能力。该模型在Conversational Dynamics评测中以98.9%的综合得分领先全球,在Speech Reasoning语音推理测试中更达到99.7%的准确率。其独特优势在于能同步解析语义、语气、情绪及环境声,支持推理计算与语音生成并行处理,工具调用与长任务执行采用异步模式,确保对话流畅性不受影响。

针对专业领域语音识别需求,StepAudio 3 ASR将高精度转录与上下文理解深度融合。该模型支持中英双语及方言混合识别,可处理长音频、专业术语及复杂声学环境下的输入,包括低语、快速连读、背景音乐干扰等场景。在医疗、法律、金融等垂直领域,其专业术语识别准确率显著提升。非流式语音识别测试中,该模型词错率(WER)低至1.7%,与另一国际团队并列全球第一。

StepAudio 3 TTS专注于自然语音合成,通过流式生成架构实现语音输出与播放实时同步。模型在音色表现、语调变化、节奏控制及呼吸停顿等维度高度拟人化,可精准还原笑声、迟疑、口吃等副语言特征。这种技术突破使合成语音在实时交互场景中更接近人类自然表达方式。

在音频生成领域,StepAudio 3 Gen开创了统一生成范式。用户通过自然语言描述结合参考音频,即可同时生成人声、音效、环境音及背景音乐。模型支持多角色音色定制,可精细调控语气、情绪、方言特征及呼吸声等细节,并具备音频时间轴编排能力,满足影视配音、游戏音效等复杂场景需求。

音乐创作模型StepAudio 3 Music提供从零生成到交互式编曲的全流程支持。用户既可通过自然语言指令控制曲风、旋律、节奏等要素,也能基于ABC记谱法进行精确创作。该模型特别强化了歌曲结构建模能力,可自动处理主歌、副歌过渡及跨段落旋律发展。在清唱配乐场景中,模型能分析人声特征并自动生成和声与乐器编配,实现从干声到完整作品的智能化转化。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version