在机器人领域,实现自然流畅的人机交互始终是一道难以跨越的门槛。当机器人置身于多人交谈的嘈杂展厅,如何精准识别对话对象、判断回应时机、在对话被打断后自然衔接,并配合恰当的肢体语言与表情,这些看似简单的日常交流细节,实则考验着机器人核心的具身智能能力。
长期以来,机器人行业陷入一个矛盾困境:尽管在视觉、听觉、语言处理等单项技术上不断突破,但将这些能力整合为连贯、类人的交互系统却始终难以实现。其根本障碍在于,感知、推理、语音和动作等模块各自独立运行,缺乏统一的时间轴协同机制。
近日,智元公司自主研发的全模态大模型WITA-Omni Preview在具身智能领域取得突破性进展。该模型在权威评测榜单DailyOmni上以85.21分的综合成绩登顶,超越千问、Gemini、豆包等国内外主流模型,在八项细分指标中六项位居榜首。这一成绩标志着具身智能企业在理解物理世界与交互能力方面已领先通用大模型厂商。
DailyOmni评测体系聚焦于真实场景下的多模态交互能力,通过大量开放环境音视频数据,考察模型对声画对应关系、事件时序判断和跨模态推理的掌握程度。与传统图文评测不同,该榜单要求模型同时处理声音和视觉信息,例如通过语音识别画面中说话对象,或根据动作判断事件发生顺序。WITA-Omni在音视频对齐、事件时序和综合推理等核心指标上均表现优异,特别是在长时序视频理解任务中建立显著优势。
传统机器人交互采用级联架构,语音识别、语义理解、回复生成和动作执行等模块依次串联运行。这种设计导致三大缺陷:响应延迟累积、信息传递损耗、语音动作不同步。例如,机器人可能先完成全部思考再开始表达,或出现嘴在说话但手势未跟进的割裂现象。WITA-Omni通过原生架构创新打破这种局限,将动作和表情生成提升为与语音并列的核心模块。
该模型采用Thinker-Talker-Actor架构,其中Thinker模块负责多模态信息融合与推理决策,Talker模块实现自然语音生成,Actor模块驱动肢体动作与表情表达。三个模块在统一时间轴上同步运行,并通过跨流同步机制实现深度耦合。例如,Actor模块不仅接收语义信息,还根据语音的语速、停顿和重音调整动作节奏,确保语音、表情和手势的自然协调。这种设计使机器人能够像人类一样边思考边表达,在对话中实现真正的多模态同步。
数据构建是WITA-Omni取得成功的关键因素。针对具身智能的特殊需求,研发团队建立分层数据体系:在中训练阶段使用千万小时级多模态数据,其中音视频联合数据占比40%用于训练声画对应关系,纯音频数据占比30%强化语音理解,视觉和文本数据分别占比20%和10%维持基础能力。为弥补公开数据不足,团队还自建高质量数据集,包含人-人交互、人-机交互视频和机器人第一视角感知数据,并标注对话轮次、响应时机和动作时序等关键信息。
在千小时级精标数据基础上,WITA-Omni采用三阶段后训练策略:首先通过监督微调建立基础能力,接着利用同策略蒸馏提升跨模态推理性能,最后通过强化学习优化交互决策。这种训练方法使模型不仅掌握正确回答问题能力,更学会在真实场景中判断回应时机、选择对话对象和调整表达方式。在国际权威评测Speech Arena中,该模型在语音推理和全双工对话能力上均超越GPT-Realtime等商用模型,特别是在对话节奏控制方面表现突出。
WITA-Omni的技术突破完整覆盖"感知-推理-表达-交互"全链路,这与通用大模型侧重内容消费的定位形成鲜明对比。在真实物理交互场景中,机器人不仅需要理解环境信息,更要掌握对话节奏、表达情绪和提供服务价值。智元公司通过构建作业智能、交互智能和运动智能的"三智一体"体系,为机器人进入工厂、商业服务和家庭场景奠定技术基础。其最新推出的七大生产力解决方案,正是基于这种完整能力栈的实践应用。











