ITBear旗下自媒体矩阵:

字节跳动Seed Audio 1.0发布:多要素编排,音色稳定,多语种自然生成

   时间:2026-07-21 00:23:40 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

字节跳动旗下Seed团队宣布推出全新音频创作模型Seed Audio 1.0,该模型通过端到端技术实现影视级音频的自动化生成,标志着声音创作从辅助性工具向独立叙事媒介的转变。与传统音频处理方式不同,该系统在统一架构下同步处理人声、环境音及特效声三大核心要素,使声音元素能够直接构建听觉场景,甚至在听众脑海中形成具象化画面。

技术层面,模型实现了三大突破性功能。首先通过单条文本指令即可完成多音频要素的时空编排,创作者可精确控制不同声音元素的入场时机与持续时间,例如让雨声随着剧情推进逐渐增强,或让人物对话与脚步声形成精准配合。其次在音色一致性方面,系统支持通过参考音频锁定角色声纹特征,即使在跨场景、跨时长的创作中,也能保持角色声音的稳定性,同时支持同一音色演绎喜悦、愤怒等不同情绪状态。

多语言支持成为该模型的另一亮点。系统内置覆盖20余种语言的发音规则库,能够根据不同语种的语法结构和韵律特点,自动调整角色声音的发音方式、语速节奏及情感表达。例如中文角色切换至西班牙语时,系统会优化卷舌音的发音强度,同时保持角色原有的音色特质,确保跨语言叙事时的声音自然度。

目前该模型已登陆火山方舟体验中心开放测试。开发者表示,这项技术将首先应用于影视配乐、游戏音效及有声读物等领域,未来可能拓展至虚拟现实、智能客服等场景。测试用户反馈显示,系统生成的音频在情感表现力和场景还原度上达到专业水准,部分功能可替代传统音频工程师的繁琐操作。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version