ITBear旗下自媒体矩阵:

浙大清华联合研发INTACT技术:机器人规划动作告别“穷举”,效率飙升300倍

   时间:2026-08-11 00:36:10 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

让机器人理解“把红色方块推到角落”这类指令,看似简单,实则充满挑战。问题不在于机器人能否识别物体或确定位置,而在于如何将“当前状态与目标状态”转化为具体的手臂动作。传统方法依赖世界模型,通过反复模拟和搜索来寻找可行方案,但这种方式效率低下,计算成本高昂。浙江大学和清华大学的研究团队提出了一种名为INTACT的新方法,彻底改变了这一局面。

传统机器人控制系统通常基于世界模型,即机器人通过观察环境构建“世界地图”,预测执行某个动作后的结果。要达成目标,系统会生成大量随机动作序列,模拟未来状态,筛选出最接近目标的方案。这一过程如同没有地图的行人,在城市中盲目探索,耗时且资源消耗大。研究团队将这种方法称为CEM(交叉熵方法),实验显示,每次规划需1.48秒,生成9000条候选序列,对需要快速反应的机器人来说,这几乎不可行。

问题的根源在于,世界模型仅能描述“动作导致状态变化”,却无法回答“要实现某状态变化,应执行什么动作”。这类似于只学会“踩油门加速”,却未掌握“超车时如何踩油门”。研究团队提出的INTACT方法,通过让机器人从示范录像中学习“意图到动作”的对应关系,绕过了穷举搜索,直接生成动作,推理延迟从1.48秒骤降至2.9到5.5毫秒,速度提升约300倍。

INTACT的核心在于利用示范录像中的隐含信息。每段录像不仅展示了动作,还揭示了“当前状态与目标状态变化”所需的动作。研究团队将这些信息整合,构建了“意图与动作的映射图谱”。例如,“向左移动一小步”与“大幅右转”对应不同的动作族群,这些关系隐藏在数据中,INTACT通过训练将其提取出来。

为实现这一目标,研究团队引入了“运动意图”的概念,即目标状态的潜在表示减去当前状态的潜在表示,形成“位移向量”。训练时,INTACT构造两种意图:物理意图(基于实际状态变化)和部署意图(基于目标状态)。两者被输入同一网络,学习预测动作。关键技巧在于,物理意图的梯度可回传至编码器,帮助保留动作区分信息,而部署意图的目标状态则固定,作为训练的锚点。

“条件动作商”理论进一步解释了INTACT的合理性。该理论指出,在当前状态下,所有诱发相同专家动作的目标状态属于同一“动作等价类”。例如,无论目标是东边的超市还是医院,第一步动作均为“向东走”。INTACT通过识别这些等价类,学会在每个类上生成正确的动作分布,而非记忆具体目标与动作的对应关系。

INTACT的推理方式令人印象深刻。训练完成后,机器人只需拍摄当前和目标场景的照片,编码为潜在向量,计算“当前目标意图”,输入INTACT预测器,即可直接输出动作序列。整个过程无需生成候选序列或反复查询世界模型,推理时间极短。实测显示,Direct模式在四个任务上的成功率分别为85.78%、100.00%、97.67%和97.89%,宏观平均成功率95.33%,远超基准系统。

研究团队还设计了“Guarded A”验证模式,将搜索作为安全阀而非必需品。Direct模式生成动作计划后,Guarded A在其附近生成少量候选序列,迭代优化,保留最佳结果。这一过程仅需384条候选序列,成功率提升至96.86%,远高于基准系统,且候选序列数量大幅减少。实验表明,搜索仅在“本地核查”语义下有益,大范围搜索反而可能破坏INTACT的意图-动作对应关系。

INTACT在多任务学习方面也表现出色。研究团队使用共享视觉编码器,同时服务四个视觉上截然不同的任务。训练时,四个任务的数据共同更新编码器,使其提取对动作有用的视觉特征。实验结果显示,共享编码器在四个任务上的Direct直接成功率分别达80.22%、99.56%、95.67%和82.11%,宏观均值89.39%,远超独立编码器的基准系统。

研究团队还比较了两种“部署意图”表示方式:路点意图和目标位移意图。路点意图将剩余距离均匀分配至每步,训练初期收敛快,但最终效果不如目标位移意图,后者保留完整方向和距离信息,让网络自行决定步长。实验显示,从路点意图切换到目标位移意图,Direct成功率在四个任务上显著提升,尤其在复杂任务中表现更佳。

为评估编码器质量,研究团队设计了“预测-专家动作族群kNN重叠”和“线性CKA”指标,衡量动作分布的结构保留能力。实验显示,这些指标与控制成功率高度相关,说明保留动作族群的整体结构比精确复现每个动作更重要。潜在空间的“有效秩”与成功率并非正相关,过高秩可能包含冗余或噪声维度,反而降低性能。

为证明INTACT的成功非偶然,研究团队设计了“配对标定”实验。通过线性变换将INTACT的编码器输出映射到另一空间,测试控制性能。结果显示,正确配对可显著提升成功率,而打乱配对则性能下降。这表明INTACT学到的表示具有一致性,通过简单变换即可对齐,进一步验证了方法的可靠性。

在与同期方法的横向比较中,INTACT展现出独特优势。它是唯一同时满足“动作监督更新编码器”、“单一编码器跨多任务”和“原生直接控制模式”的方法。其他方法要么依赖冻结编码器,要么仅针对单任务训练,或仍需搜索完成控制。INTACT在仅训练1个epoch的情况下,Direct模式成功率即达95.33%,远超同等条件下的其他方法。

尽管INTACT取得显著进展,研究团队也坦诚指出其局限性。训练规模有限,推广范围未在真实机器人或复杂场景中验证,动作分布单峰假设在多峰场景下可能失效,极端意图的预测未定义,评估协议需进一步标准化。这些局限性为未来研究提供了方向,同时也凸显了INTACT在机器人控制领域的潜力。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version