在最新发布的音视频跨模态推理评测基准“每日全模态交互能力评测”(DailyOmni)榜单中,一款来自中国的大模型以显著优势登顶。智元硅光动语大模型预览版(WITA-Omni Preview)以85.21分的综合成绩超越千问、谷歌双子座(Gemini)、豆包及英伟达旗下模型,在八项细分指标中斩获六项第一,成为全球首个在该权威榜单中夺冠的具身智能交互模型。
DailyOmni榜单作为行业公认的权威评测标准,重点考察大模型在真实开放环境下的“全模态感知”能力。与传统图文理解任务不同,该榜单要求模型在复杂物理空间中精准判断“谁在说话”“事件发生的先后顺序”,并基于此做出恰当的交互决策。这一能力被视为机器人实现自然人机交互的关键技术突破。
硅光动语大模型的创新性体现在其独创的“思考—表达—行动”(Thinker-Talker-Actor)三层端到端架构。该架构突破了传统机器人“听、看、说、动”功能割裂的局限,通过视觉理解物理世界,无需依赖语音或文字指令即可实现感知、决策与表达的统一驱动。技术团队介绍,这种设计使机器人能够像人类一样“察言观色”,在多人交互场景中自主判断回应时机、对象及内容。
在技术实现层面,该模型通过千万小时级多模态数据训练构建了坚实基础,并采用“监督微调—同策略蒸馏—强化学习”三阶段特训方法。其中,“师生模型”训练机制尤为关键:具备额外信息的“老师”模型生成高质量答案后,将这种能力复制给无额外信息的“学生”模型,同时通过“奖惩机制”确保生成内容的风格统一性和推理准确性。这种训练方式使模型在复杂音视频上下文中的推理能力得到显著提升。
值得注意的是,本次榜单前五名中,千问、豆包等三款国产大模型集体跻身前列,展现出中国人工智能企业在全模态感知领域的技术积累。这些模型在多人场景理解、时序关系推理等核心指标上表现突出,标志着中国在该领域已形成技术集群优势。
作为全国首款通过备案的具身智能交互大模型,硅光动语已于今年5月进入合规商用阶段。目前,该模型正与负责物理操作的“视觉—语言—动作”(VLA)模型及提供虚拟训练环境的世界模型GE-Sim 2.0进行深度协同。这种多模型联动机制将加速人形机器人在商业服务、公共导览等场景的规模化应用,为实体经济的智能化转型提供技术支撑。










