在机器人技术领域,一种与众不同的世界模型正引发关注。传统上,世界模型如同机器人的“脑内沙盘”,帮助其预测未来并规划动作,推理链路往往较长。然而,近期出现的一种新型世界模型却另辟蹊径,它仅在训练阶段发挥作用,待训练完成后便退出部署链路,机器人执行任务时无需再借助它进行未来搜索和候选动作规划,却意外地提升了机器人的工作能力。
这一创新成果是由光象科技联合清华大学某课题组共同推出的第一代物理原生世界模型Phi-WM 1.0 ActEffect。该技术聚焦于具身智能领域长期存在的一个问题:机器人能否利用从演示数据中学到的动作及其可能产生的后果,来优化自身的策略?毕竟,在工业场景中,机器人每多运行一步模型,都会带来新的时延、算力消耗和成本增加。若世界模型能在训练阶段发挥作用,并在执行阶段保持轻量化,其技术价值才能更好地转化为部署价值。
从测试结果来看,ActEffect交出了一份令人满意的答卷。在LIBERO基准测试中,它取得了98.8%的平均成功率;在加入七类分布偏移的LIBERO-PLUS测试中,成功率达到80.3%;面对29维动作空间的RoboCasa-GR1测试,平均成功率也有67.5%。那么,这种“反骨”方法究竟是如何实现的呢?
ActEffect的突破口在于模仿学习。目前,许多通用机器人策略都基于VLA架构,摄像头识别环境,语言指令交代任务,模型根据演示数据生成动作。但在物理世界中,动作接近并不意味着结果正确。例如,夹爪闭合的时机或手腕角度的微小偏差,都可能导致不同的操作结果。因此,ActEffect没有选择延长机器人的思考链,而是让策略生成三版动作提案:第一版是前馈分支的“第一反应”;第二版是MIP动作头给出的粗提案;第三版则是在粗提案基础上精修后的最终动作。这三份提案各自完整,为后续比较提供了基础。
接下来,受控世界模型登场。它根据当前的视觉状态和一份动作提案,预测动作执行后的场景变化。三份动作提案分别经过受控世界模型的预测,相当于让机器人在训练场中提前预演了三次结果。值得注意的是,语言指令仍由VLA策略处理,受控世界模型仅关注当前画面和动作,不读取任务语言。ActEffect将未来状态映射到冻结的DINOv3视觉特征空间,无需生成逼真的未来画面,只需捕捉物体位置、姿态和场景结构的变化,体现了“物理原生”的特点。
然而,仅预演结果还不够,关键在于将差别反馈给策略。训练数据中包含动作执行后的真实观测,受控世界模型将三次预测与真实未来进行比较,要求精提案比粗提案更接近真实,粗提案优于前馈提案。这样,策略在修改动作时就能明确是否朝着正确方向调整。为防止模型“钻空子”,ActEffect还对排序损失进行了梯度截断,确保训练推动更好的提案靠近真实未来。通过反馈信号学习,世界模型对“后果”的判断被融入策略权重。机器人上岗时,受控世界模型和未来观测分支被移除,仅保留MIP动作头完成粗提案和精修。
在了解了方法原理后,我们再来看看它在不同测试中的表现。在LIBERO测试中,ActEffect以98.8%的成功率略高于DiT4DiT的98.6%,且引入后果反馈后,机器人原有的基础操作能力未受影响。在难度更大的LIBERO-PLUS测试中,ActEffect的平均成功率为80.3%,远超Fast-WAM的51.5%。在RoboCasa-GR1测试中,ActEffect控制拥有双臂、灵巧手和腰部自由度的GR-1人形机器人,在29维动作空间中完成24项桌面操作,平均成功率达到67.5%,比第二名ABot-M0高9.2个百分点,比Fast-WAM高10.8个百分点。消融实验也进一步验证了ActEffect的有效性,去掉后果反馈、更换特征空间或拿掉排序损失后,成功率均有所下降。
那么,为什么受控世界模型必须在执行阶段“退场”呢?这与工业部署的现实需求密切相关。在实验室中,任务成功率是主要评价维度;但在真实生产环境中,算力和成本成为关键因素。机器人每多运行一层模型,都会增加产线的计算开销和成本。随着规模扩大,额外的显卡、功耗和维护成本将显著增加。ActEffect将受控世界模型留在训练阶段,避免了在线开销,让机器人“多想一会儿”留在训练时,执行时则保持更短的链路。
光象科技选择这种技术路线,与其应用场景密切相关。汽车制造中存在大量散乱件上下料、复杂曲面质检等任务,传统自动化设备难以适应零件位置变化或操作空间狭窄的情况。具身智能的目标正是提升机器人的适应能力。目前,光象科技已在焊接上下料、移动质检等高价值工位完成真实场景验证,并与多家国内外头部汽车企业展开商业合作。在2026ATC展会上,其Phi-Bot X1机器人在蔚来汽车焊接上下料场景中连续运行3天,累计作业21.5小时,实现零失误、零中断。
具身智能的发展,最终将取决于商业化能力。过去两年,机器人演示视频令人惊艳,但在客户现场,连续运行的能力才是关键。工厂验收不仅关注基准成绩,更看重节拍、精度、安全性和故障率等指标。方案的可迁移性和部署成本也是重要考量因素。ActEffect将世界模型留在训练场的做法,若能在真机上提升稳定性并降低执行阶段的算力成本,将更有利于工业系统的规模部署。
光象科技具备学术研究和汽车产业经验,为其推进具身智能的商业化提供了有利条件。其团队不仅专注于强化学习和世界模型的研究,还致力于机器人本体、数据算法体系和开发平台的搭建。在工厂环境中,硬件的可靠性、系统的易部署性和快速维护能力同样重要。目前,光象科技已完成部分真实场景验证,并与头部车企达成合作。未来,Phi-Bot X1能否在真实产线上保持稳定表现,同一套能力能否复用到新的车型、零件和工位,以及部署与运维成本能否持续降低,将成为决定这些合作能否深入的关键因素。ActEffect也需在真实环境中接受考验,其能否在产线上应对节拍、误差和连续运行的挑战,将直接影响其在具身智能领域的应用前景。











