香港浸会大学知识计算研究团队近日在机器人学习领域取得重要进展,提出一种名为TD-JEPA(Temporal-Distance JEPA)的新型架构,通过挖掘无奖励示范轨迹中的时间顺序信息,显著提升了机器人在复杂环境中的规划能力。相关研究以预印本形式发布,论文编号arXiv:2607.25337,为解决“训练-规划鸿沟”问题提供了新思路。
传统机器人学习常依赖“联合嵌入预测架构”(JEPA),其核心是通过压缩图像信息至“潜空间”并预测下一步状态。然而,这类方法在规划路径时,往往直接使用潜空间中的欧几里得距离衡量状态差异,导致“直线距离近”与“实际行进步数少”之间存在偏差。研究团队以“旅行日记”为喻:日记记录了每日行程,却未标注“哪条路更快”,机器人需从中提炼出有效的“进度尺”。
为破解这一难题,团队在现有JEPA框架基础上引入“时间感应器”,构建了TD-JEPA架构。该架构通过度量残差网络(MRN)定义“有方向的距离函数”d_ψ,将状态间的步数差分解为对称的共同特征与非对称的方向性差异。例如,机器人推积木从位置A到B与从B到A的步数可能不同,d_ψ能精准捕捉这种差异。训练时,系统从示范轨迹中提取时间标签(如状态i到j的步数为j-i),并引入“跨轨迹负样本”惩罚机制,避免无关状态对被误判为低代价路径,同时通过“五步滚动一致性损失”确保多步预测的准确性。
实验在四个典型任务中验证了TD-JEPA的有效性。在“双房间导航”任务中,TD-JEPA实现100%成功率,显著优于LeWM的97.4%;在“立方体操控”任务中,其成功率达82.2%,较LeWM提升14.2个百分点。值得注意的是,TD-JEPA采用“双角色”设计:在拓扑结构任务(如跨房间导航)中直接使用d_ψ规划,而在精细操控任务(如积木角度调整)中则结合欧几里得距离,利用时间训练优化的潜空间提升几何规划质量。
进一步分析显示,TD-JEPA的三大核心组件缺一不可。移除“有方向残差”结构后,成功率在Push-T任务中骤降至57%;取消“跨轨迹负样本”惩罚导致成功率下滑至77%;省略“五步滚动一致性”训练则使性能降至60%。这些结果证明,方向性代价函数、负样本监督与多步预测精度共同构成了架构的优势。
研究还揭示了时间距离与几何距离的适用场景差异。在Push-T任务中,d_ψ虽能更准确预测步数差(斯皮尔曼相关系数0.91 vs 欧几里得距离的0.79),但直接用于规划时,接触后阶段的精细调整易受误导。相比之下,欧几里得距离在几何姿态感知上更具优势。这一发现支持了“任务类型决定规划工具”的设计哲学:拓扑任务需“时间指南针”导航,而操控任务则依赖优化后的“潜空间地图”。
与同类方法相比,TD-JEPA无需强化学习估计价值函数,仅依赖轨迹自带的时间顺序信息,适用于无奖励信号的离线数据场景。其直接挖掘可规划代价函数的思路,较之RC-aux等通过“可达性区分”间接优化的方法,更具主动性与普适性。目前,该方法假设示范轨迹的时间顺序能合理替代“到达代价”,未来需进一步探索迂回轨迹或可达性差异较大时的适应性。











