ITBear旗下自媒体矩阵:

香港浸会大学新突破:VPW框架让AI“脑内建模”物理世界

   时间:2026-08-07 06:03:40 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

香港浸会大学研究团队提出了一种名为VisualPatchWorld(VPW)的新型机器人学习框架,旨在解决机器人理解世界运行规律并据此做出决策的难题。该研究以预印本形式发布,论文编号为arXiv:2607.25236,为相关领域研究者提供了新的探索方向。

在机器人执行任务时,例如将桌上积木推至目标位置,它需要理解自身动作与积木运动之间的关系,如推力大小、角度对积木的影响等。这种对世界运行方式的内在认知被称为“世界模型”。拥有准确的世界模型,机器人就能在行动前在脑海中模拟不同方案,选择最优方案执行,如同棋手落子前在脑中推演棋局。

此前,研究者主要有两种构建世界模型的方式。一种是利用神经网络,通过大量视频和操作数据让其在内部向量空间建立对世界的理解。这种方式虽能自动学习,但所学内容隐藏在大量参数中,难以理解和修复问题。另一种是人工编写物理引擎,程序员将物理定律写成代码供机器人使用。这种方式模型清晰可读,但每换一个新环境就需重新编写,难以大规模应用。VPW则另辟蹊径,让机器自动从观察数据中归纳出可执行的程序代码作为世界模型,兼具神经网络的数据驱动能力和物理引擎的可读性与可编辑性。

要理解VPW的价值,需先明确世界模型在智能体系中的作用。香港浸会大学研究团队引用斯坦福大学李飞飞博士提出的框架,指出真正有用的世界模型应具备渲染、模拟和规划三项职责。以厨师为例,看到一锅汤是渲染,判断火候和食材状态是模拟,决定加盐或继续等待是规划。对于机器人,这套“内心戏”就是世界模型。现有神经网络世界模型在渲染和粗略规划方面表现尚可,但内部逻辑不透明,出现问题难以修复;手工编写的物理引擎虽清晰,但编写成本高。VPW则在两者之间找到了平衡。

VPW的工作流程类似侦探破案,分为四个阶段。首先是视觉抽象,将原始像素画面转化为结构化文字描述,记录物体位置、角度、速度等信息。接着是轨迹导出,把操作录像整理成“动作前状态—动作—动作后状态”的三元组记录。然后是关键的两级程序归纳,第一级主动探测选结构,VPW会向模拟器发出精心设计的探测性动作,如给机器人施加力观察其运动情况,让机器人靠近积木观察其响应方式等,从预先定义的小型假设库中选出最符合当前环境物理规律的“动力学草图”。在推箱子任务中,假设库有三个二元选择,组合出八种可能草图,主动探测会选出最合适的一种。选定了草图后,第二级参数拟合定细节,将草图实例化为带有未知常数的Python代码模板,在大量操作轨迹数据上优化,找到让预测误差最小的参数组,且优化目标是让多步连续预测的累积误差尽量小。

有了可执行的Python程序,机器人便可用于规划行动。VPW采用的规划方法是“滚动时域模型预测控制”配合“交叉熵方法”。以迷宫寻路为例,人随机想出一百条路线,在脑中推演后挑出接近出口的路线,再以这些路线为模板生成更优化的候选路线,迭代几轮后找到不错路径。VPW的规划原理类似,只是用学到的程序代码推演路线。而且,VPW将当前状态观察和未来行动评分分为两个独立问题,观察当前状态可从真实图像提取场景描述或直接读取模拟器精确状态,评分未来行动则用归纳出来的程序代码,无需额外调用昂贵物理引擎。论文设计了“混合评分”机制处理接触密集型任务,先用归纳程序对全部候选方案粗筛,取出表现最好的前30%,再调用真实物理引擎精细验证,最终选出最优方案,减少了物理引擎调用次数且规划效果损失小。

研究团队在LeWM基准测试的四个任务上对VPW进行了评估。推箱子任务要求机器人用圆形推杆把T形积木推到指定位置和朝向,接触力学是难点。VPW通过主动探测确认适用物理草图,拟合出具体数值,仅靠归纳程序评分成功率达22%,加上混合评分后成功率升至88%到96%,接近使用真实物理引擎的天花板。双房间导航任务要求机器人在二维环境中导航到目标位置,VPW归纳出线性导航规律,归纳程序评分下成功率达96%,混合评分后提升至100%。积木操作任务要求机械臂抓取并移动方块到目标位置,VPW归纳出“夹持触发型接触”规律,成功率达86%,优于此前表现最好的代码型基线WorldCoder。机械臂到达任务要求控制双关节机械臂让指尖到达目标点,关键在于运动学。其他代码型方法因忽略关节运动约束预测误差大、规划成功率低,VPW通过主动探测识别出正确草图,拟合出参数,将预测误差压低,规划成功率提升至72%。综合四个任务,VPW平均成功率达69%,比此前最好的代码型基线高出23.5个百分点。

研究还探讨了感知误差对VPW的影响。通过对比“图像工具路径+归纳评分”和“神谕路径+归纳评分”两种条件,发现图像工具路径在推箱子任务上的位置误差与神谕路径几乎持平,说明计算机视觉管线对推箱子任务足够精确。但在机械臂到达任务中,从单张图像恢复关节角度误差较大。相比之下,用大型语言视觉模型提取场景信息效果差,坐标误差大,说明语义理解不能替代精确的空间定量描述,至少在当前VLM能力水平下,直接用通用VLM当感知层不可靠,搭配适当计算机视觉处理模块是可行路径。

尽管VPW在多个任务上表现出色,但仍存在不足。在接触密集型任务如推箱子中,成败取决于短暂接触时刻,即使物理草图准确,评分时也可能因微小预测误差导致规划成功率低。混合评分机制虽解决了部分问题,但仍存在残差缺口。当前VPW的假设库是人工预先设计的,每个环境需人类专家指定可能的物理动力学类型,自动化程度不够高,且系统动力学学习依赖模拟器状态数据,不是直接从原始图像端到端学习,图像视觉工具路径是针对特定环境设计的专用感知模块。而且,评估仅在模拟环境中进行,尚未在真实机器人上部署测试,从模拟到现实迁移会面临新挑战。

该研究的核心贡献在于提出了一条通过分步自动生成代码世界模型的路线图,将“选物理结构”和“确定具体参数”分开,使生成的世界模型既可读又可用。这种方法的可解释性让研究人员能直接审查机器人错误决策的代码问题并针对性修正。感兴趣的读者可通过论文编号查阅完整论文或访问公开代码仓库进行复现实验。

问:VisualPatchWorld与普通神经网络世界模型相比,最核心的区别是什么?答:VisualPatchWorld把世界动力学表示为可执行的Python程序,而非藏在神经网络参数里的数字向量。机器人预测出错时,可直接检查代码问题并修改;神经网络方法出错则只能重新收集数据训练,无法直接定位和修复逻辑错误。

问:VPW的主动探测是怎么工作的,为什么不直接学习参数?答:主动探测是VPW先向模拟器发出精心设计的短小实验动作,观察结果后判断当前环境物理类型,如有无惯性、接触是否触发运动等。直接学参数若一开始选错物理结构,如把有关节约束的机械臂当成自由质点建模,再怎么优化参数效果也差。先确定结构类型再拟合数值,分开做更可靠。

问:混合评分机制的70%节省是怎么计算出来的?答:标准全引擎CEM规划中,每一轮迭代需对全部N个候选方案调用一次真实物理引擎,共需N次调用。混合评分先用归纳程序对全部N个方案评分,不调用引擎,再只对评分前30%的方案调用引擎复核,即只需0.3N次调用。相比全程使用引擎的N次调用,节省了70%的引擎调用次数,且规划成功率几乎不受影响。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version