让从未到过陌生环境的机器人仅凭语言指令完成取物任务,这项看似简单的操作,实则暗藏人工智能领域长期未解的深层矛盾。浙江大学ACES实验室与浙江人形机器人创新中心联合研发的TAMP-Nav系统,通过重构视觉语言大模型(VLM)的任务分配机制,成功突破三维空间导航的技术瓶颈,在主流测试基准上刷新纪录的同时,更揭示了具身智能系统设计的关键范式转变。
传统导航系统的困境源于本质性的能力错配。当前主流方案多要求VLM直接输出三维坐标或转向角度,但这些模型训练数据全部来自二维图文对,对空间关系的理解存在先天缺陷。实验数据显示,当强制要求VLM进行三维几何计算时,系统会产生严重空间幻觉,在R2R-CE测试中成功率骤降24.8个百分点。这种"平面动物"处理立体任务的悖论,恰似让仅熟悉地图的驾驶员直接操控车辆,虽知路线却无法把握操作精度。
研究团队提出的像素到三维动作构建(Pixel-to-3D Action Formulation)方案,创造性地将导航任务解耦为语义理解与几何执行两个独立模块。系统通过四组环视摄像头获取360度场景信息,VLM仅需在二维图像中标记目标像素点,后续三维坐标转换和运动控制交由SLAM系统完成。这种分工模式使交互步数减少70%,任务完成时间缩短58%,在保持92.4%路径精度的前提下,将推理延迟控制在人类可接受范围内。
针对长距离导航的记忆衰减问题,研发团队设计了锚点轨迹记忆机制。该系统将关键决策节点(如路口、房门)存储为高保真视觉锚点,配备任务进度摘要;非关键路径则压缩为包含时空坐标的轻量级指示器(STI)。这种异构记忆结构在12.5米以上长轨迹测试中,将成功率提升至49.8%,较传统方法提高近60%。特别值得关注的是,STI编码采用旋转位置嵌入技术,通过正弦-余弦组合避免角度数值歧义,确保空间连续性感知。
在训练策略方面,两层群体相对策略优化(Two-Level GRPO)机制突破传统强化学习框架。系统同时评估全局轨迹质量(成功率、路径效率)和局部决策价值(障碍规避、思考必要性),通过退火引导采样平衡探索与利用。实验表明,这种稠密反馈机制使模型仅需9万条训练轨迹即可达到最优性能,数据效率较同类系统提升十倍以上。在注入16%深度噪声的鲁棒性测试中,系统仍保持97.2%的任务完成率,展现出较强的环境适应能力。
真实场景部署验证了该方案的技术通用性。在未做任何微调的情况下,搭载四组RGB-D相机的Unitree Go2机器人,在跨楼层、多地形的复杂环境中取得60%的任务成功率。这种零样本迁移能力源于系统架构的本质优势——高层语义决策与底层运动控制的解耦设计,有效降低了仿真到现实的环境差异影响。对比实验显示,传统端到端系统在真实场景中的性能衰减达37%,而TAMP-Nav的衰减率控制在10%以内。
研究团队通过消融实验揭示了多个关键设计要素。在思维链生成方面,使用70亿参数模型自标注的数据会导致性能下降,而采用千亿参数模型标注可使成功率提升11.3个百分点。记忆机制对比实验表明,均匀采样策略在长轨迹中会丢失62%的关键观察,全量存储则导致注意力分散,而锚点-指示器组合方案在120步以上任务中优势显著。这些发现为下一代具身智能系统设计提供了重要参考。
该成果的技术突破不仅体现在性能指标上,更在于重新定义了VLM在导航任务中的角色定位。通过将视觉专家从几何计算中解放出来,转而专注空间语义理解,系统整体效率获得质的提升。这种"各司其职"的设计哲学,为解决多模态大模型在机器人控制领域的落地难题提供了新思路。随着系统对垂直空间信息的扩展研究,未来有望在多层建筑导航、复杂地形运动等场景实现更广泛的应用。










