ITBear旗下自媒体矩阵:

上海AI实验室等突破:AI智能体告别“照搬记忆” 学会主动“校准”经验

   时间:2026-08-11 00:26:17 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

一项由多家科研机构联合开展的研究,为人工智能领域带来了新的突破。该研究提出了一种名为MemHarness的创新框架,旨在解决当前记忆增强型AI智能体在处理历史经验时面临的困境。这项成果以预印本形式发布,论文编号为arXiv:2607.28272v1,为相关领域的研究提供了新的思路。

在日常生活里,人们常遇到这样的情况:朋友曾告知某餐厅停车方便,但当实际前往时,却发现街道正在施工,根本无处停车。这时,人们不会机械地遵循朋友的记忆,而是会根据实际情况调整策略。然而,现有的AI智能体在利用历史经验时,往往采用简单粗暴的方式,将过去的记录直接用于当前决策,就像用旧地图导航新城市,完全不考虑城市可能发生的变化。这种“逐字回放”的方式,在语义上可能与当前任务相关,但在执行状态上却可能完全不匹配,导致“负迁移”现象,即旧经验不仅没有帮助,反而误导了决策。

受到认知科学的启发,研究团队认识到人类的记忆并非录像机式的回放,而是一个主动重构的过程。每次回忆时,大脑都会结合当前情境和知识,对过去的经历进行重新解读和组织,从而影响后续行为。基于这一洞察,MemHarness框架应运而生,其核心理念是记忆是被重构的,而非简单回放。

以经验丰富的外卖配送员为例,他有一本记录各种小区进门方式、路况等信息的经验册。当接到新订单时,他会参考相似任务的记录。但如果某栋楼东门被封,而经验册里写的是“走东门直接刷卡进入”,这条记录就会成为误导。这正是现有记忆增强型AI智能体面临的问题。现有的这类智能体主要分为两类:一类是“显式记忆型”,拥有外部经验库,可随时查阅,但缺乏对当前状态的适应能力;另一类是“参数化记忆型”,经验被融入模型参数,行动时自然流露,但无法核查或纠正。MemHarness则试图在这两者之间找到平衡,既保留显式记忆库的透明可追溯性,又赋予智能体主动评估和重构记忆的适应能力。

MemHarness的运作逻辑分为五个阶段,构成“感知—检索—评估—重构—行动”的闭环。首先,智能体感知当前所处的真实状态,包括最近的行动历史和当下观察;接着,根据当前情境生成检索查询,从历史经验库中取出相关记录,并附带这些记录生成时的原始情境;然后,智能体将历史经验的原始情境与当前情境进行比较,判断记忆的适用性;之后,保留有效知识,修改或丢弃不匹配的内容,生成经过“校准”的指导信息;最后,以重构后的信息为基础,做出当前步骤的具体决策。若评估发现记忆不适用,智能体会输出空信号,切换到“纯自主推理”模式,避免被错误记忆误导。

在技术实现上,MemHarness的设计颇具巧思。记忆重构和最终行动决策由同一个策略模型完成,共享全部参数,就像一个人用同一套大脑同时负责“分析情况”和“做出决定”。更重要的是,重构能力无需人工标注“正确的重构示例”,而是通过强化学习自发涌现。系统采用GRPO算法,同时让智能体尝试多条轨迹,根据任务完成情况评判轨迹优劣,调整策略,引导模型擅长有益的重构行为。奖励信号设计也十分合理,主要奖励来自任务结果,同时有小额格式奖励鼓励遵守交互协议,确保主任务的重要性。

为了检验MemHarness的实际效果,研究团队选择了ALFWorld和WebShop两个测试平台。ALFWorld是模拟家庭室内任务的文本环境,包含六种任务类型;WebShop是模拟在线购物的环境,有超过110万件商品,智能体需根据用户需求完成操作。以Qwen2.5-7B-Instruct模型为基础,MemHarness在ALFWorld上实现了85.2%的平均任务完成率,在WebShop上成功率达到75.6%,综合评分87.4分。对照实验显示,纯强化学习基线在两个环境中的成绩均低于MemHarness,而“逐字回放”方案在ALFWorld上成绩反而下降,印证了“逐字回放”会造成负迁移。

研究团队还通过消融实验,精确量化MemHarness各个组件的贡献。移除记忆重构模块后,ALFWorld成绩下滑,证明重构是性能提升的关键。用通用语言模型执行重构,成绩大幅下降,说明重构能力需通过端到端强化学习内化到策略中。训练了记忆重构能力的模型,在测试时不使用记忆库,成绩仍高于普通强化学习基线,表明重构训练提升了智能体的内在推理能力。

在面对“分布外”问题时,即训练时没见过的新情况,MemHarness也表现出色。在ALFWorld的分布外测试集上,MemHarness的平均成功率高于“逐字回放”方案和完全不用记忆的方案,说明其记忆重构机制能起到保护性过滤作用,避免智能体被不匹配的记忆误导。

为深入探究智能体的记忆重构行为,研究团队设计了机制探针实验。宏观层面的消融测试显示,隐去记忆原始情境会降低任务成功率,替换为错误情境会增加拒绝率,说明智能体在主动做情境匹配。微观层面的反事实探针实验表明,修改关键细节使记忆不适用后,智能体的反应会发生相应变化,进一步证明其重构行为是有意义的。

追踪强化学习训练过程,研究团队发现智能体的记忆使用行为会动态变化。在ALFWorld中,智能体逐渐形成“稀疏检索”策略,学会在真正需要时才触发检索;在WebShop中,智能体保持频繁检索,同时发展出主动过滤机制。成功率与记忆决策的关联分析显示,包含“接受重构”的轨迹成功率始终高于“拒绝重构”的轨迹,说明智能体能有效区分记忆的适用性。

研究团队在附录中提供的两个案例,生动展示了MemHarness的重构魔力。在ALFWorld中,系统检索到的历史记忆与当前任务细节不符,MemHarness重构后保留了通用结构,替换了具体对象,避免了幻觉信息。在WebShop中,系统检索到的历史记忆是抽象操作建议,MemHarness重构后“执行”了启发式规则,输出了具体可行动的目标商品ID。

这项研究不仅为AI智能体的发展提供了新方向,还带来了一个启示:训练时学会重构记忆的智能体,即使没有记忆库,也表现更佳。这暗示着“批判性地审视和改写信息”的能力可能是一种普适的推理素养。对于这一成果,感兴趣的读者可通过相关编号查阅完整论文。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version