字节跳动近日宣布,其自主研发的原生音视频全双工大模型SeedRealtime已在豆包App全面上线。用户只需将应用更新至最新版本,即可通过“打电话”功能进入视频通话界面,体验实时音视频AI交互服务。这一创新标志着AI技术从传统问答模式向真实场景深度交互迈出了重要一步。
该模型采用突破性的统一端到端架构,将音频、视频和文本处理原生融合,使AI能够同步完成感知、理解、决策与表达的全流程。与传统依赖多个独立模块串联的级联系统不同,SeedRealtime消除了多模块间的延迟和信息损耗,同时不再需要外部语音活动检测(VAD)技术进行对话轮次判断,实现了真正意义上的“边看、边听、边说”实时交互能力。
技术团队重点强化了三项核心能力:音视频联合理解、主动交互和自然对话节奏控制。通过整合画面、声音和时序信息,模型能够精准识别用户意图。例如,在处理同音词时,系统会结合视觉信息消除歧义;当用户指向某个物体时,AI可立即识别指代对象并持续跟踪画面变化,在目标出现时主动提醒。这种多模态融合能力显著提升了交互的准确性和实用性。
实际应用场景测试展现了模型的强大适应性。在多人聚会场景中,系统能准确识别不同发言者身份并持续跟踪对话;为外国游客提供服务时,可实时翻译中文菜单和店员介绍;在博物馆导览场景中,当用户镜头对准指定文物时,AI会自动弹出相关信息;辅助操作咖啡机时,系统能根据画面变化实时纠正操作步骤;阅读学术论文时,可监测翻页进度并在指定章节出现时自动提示。
复杂环境下的表现同样出色。在机场等嘈杂场所,模型能准确区分用户与他人的对话,避免背景噪音或无关交谈引发的误响应;在儿童学习场景中,系统可专注跟随用户互动,不受背景电话铃声等干扰。这些能力得益于模型对多模态信息的综合判断,使其能够智能决定何时回应、何时保持沉默。
端到端人工评测数据显示,相比传统级联系统,SeedRealtime将对话节奏问题减少了约50%。具体表现为抢话现象、回应延迟和背景噪声误触发等情况显著改善,同时单次对话的完整流畅度得到提升。这些改进得益于模型架构的优化,使得信息处理更加高效协同。
目前,研发团队正持续优化模型的端到端时延、主动感知决策、多人场景理解和工具调用等关键能力。通过不断迭代升级,SeedRealtime将逐步拓展至更多真实场景,为用户提供更加智能、自然的交互体验,推动AI技术向环境感知和任务协助方向深入发展。









