今日,阶跃正式对外发布StepAudio3系列模型,涵盖StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen和StepAudio3Music五款产品。该系列模型在多个核心场景中展现出技术突破,其中多款模型在国际权威评测榜单Artificial Analysis中位列全球首位,目前均已接入阶跃星辰开放平台供开发者使用。
针对实时语音交互场景,StepAudio3Realtime模型通过原生全双工架构实现对话节奏的精准把控。该模型在Artificial Analysis Conversational Dynamics评测中以98.9%的综合得分登顶全球,其核心优势在于能够同时处理语音理解、推理判断和任务执行。在复杂对话场景中,模型可识别用户语气、情绪及环境声,支持推理与语音生成的并行处理,并通过异步执行机制实现长任务与实时对话的无缝切换。该模型在Speech Reasoning评测中以99.7%的准确率刷新纪录,展现出对音频内容的深度理解能力。
语音识别领域迎来突破性进展,StepAudio3ASR模型将传统转写升级为语境理解。通过融合大语言模型的知识推理能力,该模型在医疗、法律、金融等专业场景中实现人名、术语等复杂内容的精准识别,词错误率(WER)低至1.7%,创下Artificial Analysis非流式语音识别榜单新纪录。模型支持中英混说、方言及长音频处理,可应对快语速、含糊发音等复杂输入,在会议纪要、智能客服等场景中显著提升信息处理效率。
语音生成技术实现质的飞跃,StepAudio3TTS模型通过流式架构实现生成与播放同步进行。该模型突破传统朗读模式,能够模拟笑声、迟疑等副语言特征,结合语义内容自主调整情绪语气。在实时交互场景中,模型通过多层语调控制和节奏律动设计,使合成语音在音色、停顿等方面高度接近真人表达,为车载系统、智能助手等应用提供更自然的交互体验。
完整音频内容生产迎来范式革新,StepAudio3Gen模型实现人声、音效、环境音的统一生成。用户仅需通过自然语言描述场景,即可生成包含多角色对话、背景音乐和环境声的完整音频,无需分步制作。模型支持对角色音色、方言口音及音效出现时序的精细控制,在影视配音、游戏音效制作等领域将传统多环节流程压缩为单次生成,大幅降低创作门槛。
音乐创作领域出现交互式生产工具,StepAudio3Music模型支持多轮创作与结构化控制。除基础的歌曲生成功能外,用户可提供歌词、清唱或乐谱片段,模型能够延续创作并完成编曲、配器等后期制作。通过自然语言指令,创作者可精确控制曲风、乐器组合及段落衔接,模型对主歌、副歌等结构进行建模,确保生成作品具备完整的音乐逻辑。在清唱配乐场景中,模型可自动分析旋律情绪并匹配和声编排,为独立音乐人提供智能化创作支持。











