在国际具身智能领域,一场重要的突破刚刚诞生。智元自主研发的具身原生全模态大模型WITA-Omni Preview,于国际权威评测榜单DailyOmni的最新测评中脱颖而出,以85.21分的综合成绩荣登榜首,超越了千问、Gemini、豆包以及英伟达等国内外主流模型,在八项细分能力测试中斩获六项第一。这一成绩标志着智元在机器人面向真实物理世界的全模态理解与交互能力上实现了关键性进展。
DailyOmni榜单在业内具有极高的权威性,是评估音视频时序理解与跨模态推理能力的重要第三方评测平台。与传统侧重图文或短视频理解的评测不同,该榜单大量采用开放环境中的真实音视频素材,重点考察模型能否同时融合视觉画面与环境声音,准确识别声画对应关系、事件发生顺序以及跨模态语义的综合能力。这些能力对于人形机器人在真实物理空间实现自然人机交互至关重要。
WITA-Omni的创新之处在于突破了传统架构。它并非简单地将大语言模型应用于机器人,而是将物理动作和表情提升为与语音同等重要的一级输出,通过一个原生端到端模型统一驱动感知、决策与表达。这一架构从传统的Thinker–Talker范式扩展为面向具身输出的Thinker–Talker–Actor架构,使机器人的“理解”与“回应”从割裂的步骤转变为持续发生、实时联动的过程,首次真正实现了“看、听、说、动”在同一时间轴上的融合。
WITA-Omni的领先优势并非单纯依赖模型参数规模,而是建立在面向具身交互的大规模数据体系与针对性训练策略之上。在训练阶段,该模型基于千万小时级的多模态数据进行训练,将强文本、视觉底座升级为具备“听得见、看得懂,并进行音画联合推理”能力的全模态模型。针对公开音视频数据缺乏真实交互中轮次切换、响应时机、动作和表情信息的问题,智元构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留了声音、画面、语言、动作和表情之间的天然时序关系。这使得模型不仅学会“回答正确”,还能在真实场景中判断是否需要回应、何时回应以及回应对象。
作为具身智能行业首个机器人原生端到端全模态交互大模型,WITA-Omni的价值不仅在于支持更多模态,更在于首次将视觉、听觉、语言、动作和表情统一到同一个认知状态和时间轴中,实现机器人持续感知、统一判断和同步表达。相比传统模块化流水线式交互方式,WITA-Omni推动机器人交互从“依次调用多个模块”迈向“统一生成一个完整交互过程”,使机器人具备自然交流所需的在场感、连续性和人格化表达能力,为具身智能在工业制造、商业服务、公共服务、文旅展演等场景的大规模落地提供了新的技术支撑。
此次在DailyOmni榜单中位居全球第一,验证了WITA-Omni在物理世界视听时序理解任务上的独特竞争力。依托WITA-Omni构建的交互智能底座,智元将进一步优化“三智一体”技术架构,与作业智能、运动智能协同联动,持续驱动“本体-数据-模型-场景”四维一体飞轮运转,拓展更多商业和公共服务场景的应用可能性。











