在科技飞速发展的当下,人形机器人正逐渐从实验室走向实际应用场景,然而,交互生硬的问题却如同一道难以跨越的沟壑,阻碍着它们真正融入人类生活。近日,具身全模态理解权威榜单DailyOmni公布了最新评测结果,智元自研的WITA - Omni Preview以85.21分的综合成绩一举登顶,超越了千问、Gemini、豆包、英伟达等18款国内外主流模型,在八项细分指标中更是斩获六项第一,这一成绩为解决人形机器人交互难题带来了新的曙光。
在人工智能领域,大模型榜单层出不穷,但DailyOmni榜单却独树一帜。常规的多模态榜单多聚焦于图文问答,主要考验模型对图片内容的识别以及文字问题的回答能力,更适用于线上内容消费场景。而DailyOmni的测试集则大量采用开放环境的真实音视频素材,着重考核模型三个关键能力:能否将画面中的人物与声音精准对应,能否理清事件发生的先后顺序,以及能否结合视听信息进行跨模态推理。这就好比普通榜单考的是“看图说话”,而DailyOmni考的是“察言观色”,更贴近真实社交场景中人类所需的感知能力,也是人形机器人在家庭、工厂、公共服务等场景中最为刚需且欠缺的感知基础。
过去,模块化机器人方案存在诸多弊端。视觉、语音、决策分属不同模块,数据在多个系统间流转,不仅延迟高,还常常出现“声画错位”的现象。例如,画面中的人已经移动到左边,语音识别却还停留在上一个指令,机器人的反应总是慢半拍。在多人同时说话的场景下,机器人更是难以精准定位交互对象,经常答非所问。DailyOmni榜单也因此被业内视为具身智能感知能力的“试金石”,智元WITA - Omni能够登顶,意味着在机器人急需的视听时序理解能力上占据了领先地位。
WITA - Omni之所以能在时序推理方面表现出色,关键在于它采用了面向具身场景的三层架构:Thinker(思考) - Talker(说话) - Actor(动作),跳出了“把聊天大模型装进机器人”的传统思路。以往的机器人交互如同一条流水线,视觉模块处理画面,语音模块转写文字,大模型生成回答文本,最后运动控制模块转化为肢体动作和表情。各环节依次进行,前一步未完成,后一步就无法启动,不仅延迟高,各模块还容易“配合失误”,导致交互生硬。而WITA - Omni将感知、决策、表达整合到同一个端到端模型中,共享同一套认知状态。Thinker作为核心,将视觉、音频、文本统一映射到同一语义空间进行联合推理;在此基础上,Talker流式生成语音,Actor同步输出动作和表情,三者并行推进,共用同一时间轴,实现了“边想边说,边说边动”,与真人聊天状态更为接近。比如用户呼唤机器人名字时,它能一边顺着声音方向转头,一边开口应答,眼神和动作同步跟上;讲解物品时,手指指向位置和嘴里说的内容精准对应,避免了“指东说西”的错位感。这种一体化设计有效解决了行业长期存在的“交互割裂感”,在多人对话场景中,模型能通过声画同步判断说话者和目光方向,从而确定回应对象,不再对着空气作答;在持续交互中,也能判断何时倾听、何时插话,更符合人类社交习惯。
同样是多模态大模型,为何专门做具身的在时序交互上更具优势?答案在于数据和训练方法。普通公开音视频数据集大多仅标注画面和语音内容,如“说了什么、发生了什么”,却不会标注“何时回应、对谁回应、做什么表情动作”。用这类数据训练出的模型虽能答对问题,却不懂交互的“分寸感”,如同只会背书却不知聊天时机的人。为解决这一问题,智元构建了一套以人为中心的全模态数据集,完整保留真实交互场景中声音、画面、语言、动作、表情之间的时序关系,将人类社交的“节奏”融入训练数据。在此基础上,模型采用三阶段训练策略:先用监督微调打基础,让模型学会基础视听理解和表达;再用同策略蒸馏方式,使模型在“有额外信息辅助”和“无辅助”状态下对齐,提升复杂上下文推理精度;最后用强化学习优化交互决策,奖励信号不仅包括“答案正确”,还涵盖时间点、交互对象、是否主动回应等社交维度指标。这相当于教人社交,不仅要教说正确的话,还要教察言观色、把握时机,这也是WITA - Omni与普通全模态模型的核心区别,其训练目标从“回答准确”升级为“交互自然”。
随着人形机器人运动能力逐渐成熟,行业竞争重心正从“走得稳、抓得准”向“交互自然、融入人类场景”转移。此前在WAIC 2026上,多家厂商展出的人形机器人虽能完成行走、抓取、搬运等动作,但人机交互仍显生硬,多数停留在“指令 - 执行”初级阶段。不过,高质量具身交互训练数据稀缺仍是行业瓶颈。智元千小时级的专项数据集虽覆盖典型交互场景,但面对家庭、工厂等复杂多变的真实环境,数据的丰富度与泛化性还需在实际落地中持续扩充。
智元WITA - Omni登顶榜单,释放出一个重要行业信号:具身智能竞赛已从单维度运动能力比拼进入综合交互能力下半场。如今主流产品运动能力已达可用门槛,接下来谁能让机器人更自然融入人类环境,谁就能获得下一阶段入场券。从全球范围看,特斯拉Optimus、Figure 01等产品都在加速端到端多模态交互研发,试图让机器人从“执行命令的工具”变为“能协作的伙伴”。智元此次在具身全模态榜单上领跑,表明中国厂商在具身认知算法层面已进入全球第一梯队。对智元自身而言,WITA - Omni是其“三智一体”架构中交互智能的核心底座,后续将与运动智能、作业智能联动,支撑机器人在更多场景落地。但从榜单成绩到真实商用,还有漫长的工程化路径要走,算力成本能否降低、真实场景稳定性能否达标、量产时体验能否一致,都是比跑分更现实的考验。










