在具身智能领域,让机器人完成拧灯泡、抽取叠放纸杯等日常操作,一直是科研人员努力攻克的难题。尽管这些动作对人类而言轻而易举,但对机器人来说,稳定执行却充满挑战。近年来,机器人基础模型的研究方向逐渐转变,从针对单项任务训练,迈向利用视觉、语言和动作数据学习通用策略的新阶段。
视觉语言动作模型(VLA)能够依据画面和指令输出相应动作,世界模型则尝试预测动作执行后环境的变化。然而,若要让机器人真正进入工位、厨房和家庭场景,仅仅具备完成动作的能力还远远不够。人类在与现实世界交互的过程中,积累了海量经验,涵盖观察物体的方式、用手操作的方法,以及接触失败后的调整策略等。如何让模型、训练数据和机器人本体围绕这些经验协同发展,成为具身智能研究的重要方向。
生数科技研究团队与清华大学共同研发的Motus2模型,为解决这一问题提供了新的思路。该模型面向高自由度灵巧操作,已在采用WUJI Hand 2、Sharpa Wave等灵巧手的双臂机器人上完成测试。Motus2的技术路线围绕人与模型、数据和硬件的关系展开,通过共享模型连接动作生成、后果预测和价值评估。它从约13万小时人类第一视角视频中提取操作先验,再利用机器人轨迹实现本体适配。在执行任务时,双目视觉、工作记忆和触觉传感分别提供深度、历史与接触信息。
Motus2的核心创新在于让机器人在行动前“多想一步”,并将想象结果转化为学习信号。其前代模型Motus已实现视频与动作的联合建模,Motus2在此基础上加入价值模型。该模型能够提出动作、预测后果,并判断其是否接近目标,反馈结果不仅用于筛选当次动作,还用于更新策略。
在工业机器人领域,传统方法依赖预设轨迹、状态机或人工设计的规划器,在工位、物体位置和流程高度确定的情况下表现稳定。但当物体形态、摆放方式或任务指令发生变化时,规则与轨迹往往需要重新设计。近年来,模仿学习和视觉语言动作模型通过学习示范数据中的“观测—动作”映射,提高了任务泛化能力,但这类方法通常缺乏对动作后果及其任务价值的显式判断。世界模型则另辟蹊径,它先根据当前观测和候选动作预测未来环境变化,为机器人提供近似的内部模拟器。
Motus2在原有结构中增加价值模型,使机器人能够依据任务目标,在多个可能结果中判断哪一种更值得执行。为确保模型兼顾动作、预测和评价,Motus2采用动作优先的信息流,让动作只读取此前信息,未来视频读取动作,价值评估再读取动作和预测结果,保证动作生成过程符合真实部署时的因果顺序。预测和评价结果分为两条路径,一条用于推理阶段的当次动作选择,另一条用于训练阶段的长期策略更新。
在推理阶段,模型通过Best-of-N规划生成多个候选动作,分别预测其后果并评分,选择较优方案执行。完成一个动作片段后,机器人重新获取真实环境中的观测,开始下一轮规划。在训练阶段,Motus2引入基于模型的强化学习(MBRL),将模拟器预测的未来和评估器给出的价值转化为策略更新信号,使模型更容易生成有利于完成任务的方案。失败数据在该体系中也发挥了新作用,经过筛选的成功示范可直接监督动作学习,失败和次优轨迹则用于学习动作导致的环境变化,为价值模型提供判断依据。
研究团队在放置手机和多指操作两项真机任务中进行了每项20次闭环测试。基础策略的平均成功率为65%,单独加入规划后达到67.5%,单独加入MBRL后达到72.5%,同时使用两种机制后达到75%。结果表明,推理时规划使成功率提高了2.5个百分点,MBRL带来的提升为7.5个百分点,二者结合后较基础策略共提高10个百分点。
数据是训练灵巧操作模型的另一大难题。灵巧手单手自由度超过20个,遥操作采集数据需要设备、操作者和标定,还要承担磨损与安全成本。目前,业内常见的数据扩展路径包括大规模机器人遥操作、仿真生成与从人类视频中提取先验。机器人数据最接近部署本体,但成本高且覆盖范围有限;仿真便于批量试错,但与现实存在差距;互联网或第一视角视频规模大,却缺少可直接执行的机器人动作标签。
Motus2采用分层的数据扩展路径,先从人类第一视角视频中学习操作经验,再逐步迁移到机器人。其数据体系包含约13万小时原始录像,训练依次使用单目视频、同步双目视频与人类动作,最后加入机器人轨迹和人机对应数据。论文披露的第一视角语料约13万小时,其中超过11万小时为单目数据,覆盖多种物体、场景和人类操作行为。第二阶段引入约1.74万小时同步双目素材,提供视差形成的隐式深度线索,支持更准确的三维手部姿态估计。由于人手与灵巧手在关节数量、尺寸、活动范围和控制接口上存在差异,Motus2使用数十小时人机对齐数据和超过100小时的中间训练数据,通过目标任务数据完成后训练,将人类操作经验转化为特定机器人可执行的动作。在五项真机任务中,仅经人类数据预训练的模型平均成功率为51%,加入机器人域中间训练后升至84%。
完成本体适配后,机器人仍需解决历史信息和实时接触信息不足的问题。业内通常通过扩大视觉上下文、压缩历史为记忆标记,或引入力觉和触觉传感来补足信息,但前者面临历史完整度与计算量的取舍,后者则要处理采样频率、噪声、传感器形态和模型融合成本。Motus2分别引入工作记忆与触觉专家,使机器人能够调用此前观测,并根据最新触觉反馈调整动作。
在寻找隐藏方块和依据历史提示按键两项测试中,Motus2比较了保留完整历史的全局自回归和把中间历史压缩成标记的混合记忆。结果显示,在仿真环境中,全局自回归的平均成功率为78%,混合记忆为52%;转移到真机后,两者分别为57.5%和25%。这表明,在两项测试中,直接读取完整历史比压缩历史信息更有利于完成任务,但也反映出记忆方式需要在信息完整度与运行成本之间取舍。
触觉处理的是另一种不可见信息。在抽取叠放纸杯和撕纸等任务中,指尖传感器能够更早捕捉接触力和形变,而摄像头通常要等物体发生明显位移后才能确认失误。Motus2沿用T-Rex的触觉响应思路,设置轻量触觉专家,主模型生成动作片段并缓存特征,每个短片段执行前,专家读取最新触觉,对尚未执行的动作作最后修正。在抽取纸杯和撕纸两项任务中,加入触觉后平均成功率从60%升至72.5%。
生数科技还提出了通用世界模型(GWM)五级演进路线,描述通用世界模型从生成环境走向自主行动的能力演进。Motus2已掌握L3“在世界中行动”的关键能力,能够理解当前状态、预判行动后的未来,并生成可执行的真实机器人动作。其将evaluation与Feedback明确接入闭环,形成“行动→预测→评估→反馈→再学习”的循环,初步展现出类似递归自我改进的特征,为从L3迈向L4“自主世界智能体”进行了重要探索。











