在国际具身智能领域的权威评测中,一款由中国团队自主研发的全模态大模型WITA-Omni Preview引发行业关注。该模型以85.21分的综合成绩登顶DailyOmni榜单,在音视频联合理解与时序推理等核心指标上超越千问、Gemini等国内外主流模型,并在八项细分能力测试中取得六项第一。这一突破标志着机器人对真实物理世界的交互理解能力迈入新阶段。
传统机器人交互系统采用模块化架构,视觉、语音、运动控制等模块独立运行,导致信息传递存在时延且各模块间协同困难。WITA-Omni的创新性在于构建了Thinker-Talker-Actor三位一体架构,将物理动作和表情表达提升为与语音输出同等级别的核心功能,通过端到端模型实现感知、决策与表达的统一驱动。这种设计使机器人的"看、听、说、动"首次在时间轴上实现真正同步。
支撑模型性能突破的是其独特的数据训练体系。研发团队构建了千万小时级的多模态训练集,其中包含大量真实交互场景中的轮次切换、响应时机等关键信息。通过保留声音、画面、语言、动作和表情的天然时序关系,模型不仅学会正确回答问题,更能自主判断何时回应、如何回应以及回应对象。这种训练方式使机器人交互从"机械应答"升级为"情境感知"。
作为具身智能领域首个机器人原生交互模型,WITA-Omni的价值体现在认知状态的统一性上。它将视觉、听觉、语言、动作和表情整合到同一认知框架,使机器人能够持续感知环境变化、同步生成交互行为。相比传统模块化系统需要依次调用多个功能模块,新架构可直接生成完整的交互过程,显著提升了机器人在复杂场景中的适应能力。
该技术的突破为具身智能的产业化应用开辟了新路径。在工业制造领域,具备自然交互能力的机器人可承担更复杂的装配检测任务;在商业服务场景,机器人能通过表情和动作传递服务温度;在文旅展演行业,人机协同表演将突破现有技术限制。研发团队透露,WITA-Omni已形成可扩展的技术底座,能够与作业智能、运动智能等模块深度融合,推动具身智能技术在更多维度的落地应用。










