在具身智能领域,世界模型正成为各大公司竞相布局的技术焦点。今年5月至8月,至少十家相关企业相继推出各自的世界模型方案,世界机器人大会上,这一技术方向也成为多家厂商展示的核心内容。短短数月,世界模型从探索阶段迅速跃升为行业重点,但随之而来的疑问是:这究竟是技术发展的必然结果,还是又一个被快速复制的热门概念?
对于机器人而言,世界模型的意义已超越简单的“未来预测”。它需要帮助机器人理解环境变化的内在逻辑,并服务于动作生成、规划与决策。然而,不同企业在技术路径和目标上存在显著差异。例如,光象科技联合清华大学团队发布的物理原生世界模型Phi-WM 1.0 ActEffect,便试图通过“物理原生智能”技术路线,构建一套通用具身大脑,将世界模型、数据、算法与机器人本体深度融合。
当前,许多具身智能模型依赖模仿学习,即通过观察人类操作生成动作。这种方法在固定任务中表现良好,但在复杂环境中容易失效。例如,零件位置变化、动作力度差异或任务链中的微小偏差,都可能导致结果偏离预期。世界模型的出现为这一问题提供了新思路:通过内部表征环境状态与变化规律,辅助机器人预测未来、规划动作。但光象科技认为,仅回答“未来会怎样”远不够,机器人还需理解“动作如何改变世界”。
以汽车上下料场景为例,传送带运动、光照变化、零件振动等环境因素,与机械臂的推、抓、抬、放等动作相互交织。若模型无法区分环境变化与自身动作的影响,便难以回答“换一种动作会怎样”的问题。为此,光象科技提出“物理原生智能”框架,其核心在于让机器人在物理交互中学习底层规律、动作后果及物理约束,形成闭环自进化的智能体系。该框架包含三个关键特征:状态解耦表征、时序因果驱动与物理定律约束。
具体而言,模型将机器人的关节角、速度等显式物理状态与图像、点云等隐式状态分开处理,前者利用物理知识描述,后者交由神经网络学习。同时,模型需对动作干预保持敏感,确保动作与后果的时序关联。通过引入对称、守恒等底层约束,模型在长期推演中保持稳定性。ActEffect作为这一框架的首代模型,将“动作因果”纳入训练过程,要求模型不仅预测未来状态,还需判断不同动作是否符合物理规律。
训练中,模型生成三个精细度不同的动作提案,分别预测其结果并优化策略。例如,在工厂场景中,机器人需理解夹爪闭合时间、移动速度或角度变化对任务的影响。这种设计直指具身智能的泛化难题:若机器人掌握重量、形状等底层规律,面对新物体时便能快速适应,而非依赖大量数据重新拟合。光象科技创始人张涛举例称,传统方法需通过海量数据学习处理数十种物体,而物理原生智能可利用压缩知识更快适应新场景。
与纯视频预测模型不同,ActEffect更关注隐状态空间中的物理信号与动作驱动的状态转移。光象实验室首席科学家吕尧指出,视频预测依赖统计相关性,缺乏物理约束,可能导致“99%到100%”的失败风险。而世界模型需回答“动作如何改变世界”,而非仅预测未来画面。这一思路也体现在模型设计上:世界模型仅在训练阶段发挥作用,通过预测动作后果优化策略;部署时,机器人仅需策略网络一次计算输出动作,大幅降低推理算力成本。
数据利用方面,光象科技采用分层策略:互联网视频与无标注数据帮助建立基础世界先验;带动作标注的数据学习状态变化关系;仿真数据提供低成本反事实探索;最终通过真机后训练验证模型。张涛透露,按此路径,具体任务的真机训练数据仅需十至几十小时,最多不超过100小时。这一效率对工业场景至关重要——若每进入新工位都需海量数据与长时间训练,规模化将难以实现。
在公开基准测试中,ActEffect在LIBERO、LIBERO-PLUS和RoboCasa-GR1上分别取得98.8%、80.3%和67.5%的平均成功率。例如,在LIBERO单臂多任务操作基准中,模型在空间关系、物体操作等四类任务上均领先;LIBERO-PLUS引入相机扰动、光照变化等七种干扰后,模型仍保持较高成功率。不过,吕尧强调,基准测试需回归真实场景,最终评价标准仍是任务成功率与客户价值。
光象科技的实践也印证了这一思路。今年6月,其发布的工业级自进化具身智能机器人Phi-Bot X1已在多家豪华车厂完成验证,并进入部署阶段。在世界机器人大会上,同一台机器人展示了跨工位能力:既能完成新能源汽车焊接车间的高精度上下料,也可执行汽车表面移动质检。5天累计36小时的自主循环作业,验证了模型与本体的协同效率。
光象科技的技术路线始终围绕软硬一体展开。张涛认为,仅做大脑缺乏真实行业入口与数据闭环,仅做本体则易陷入硬件同质化。因此,公司同时推进具身大脑、机器人本体与产业场景的演进:真实环境中的任务与数据反馈持续优化模型,模型能力再迁移至机器人,形成闭环。这一逻辑下,世界模型不仅是技术工具,更是连接机器人与真实世界的桥梁。











