人工智能领域的一项新突破为解决AI“健忘症”问题提供了创新方案。由多所高校与企业联合研发的SkillRise强化学习框架,通过构建可跨任务迁移的“技能手册”,使AI智能体在连续完成相关任务时能够持续积累经验,显著提升了任务处理效率。这一成果已在三个经典文字交互环境中完成验证,实验数据显示其性能超越现有主流方法,最高领先幅度达8.5个百分点。
传统强化学习模型普遍存在“任务割裂”缺陷,每次处理新任务时均需从头探索,导致学习效率低下。研究团队以手工艺人积累经验为灵感,设计出让AI在任务执行后立即总结通用规则的机制。该框架通过“任务排序-执行-总结-迭代”的闭环流程,将每个任务的处理结果转化为可复用的技能模块,形成类似工作手册的知识体系。这种设计使AI在处理后续任务时,能够直接调用手册中的通用策略,避免重复试错。
在模拟家居环境的ALFWorld测试中,SkillRise在六类任务中取得85.9%的综合成功率,较最优基线方法提升2.3个百分点。在需要同时处理颜色、尺寸等多维度条件的WebShop购物场景中,其优势扩大至7.1个百分点。更引人注目的是ScienceWorld科学实验场景的表现,该框架以54.6%的成功率领先第二名8.5个百分点,展现出在复杂决策任务中的突出能力。
研究团队通过消融实验证实了框架设计的有效性。当移除跨任务经验传递机制后,模型性能下降超过6个百分点,证明技能手册的持续更新是提升性能的关键。与需要独立记忆模块的RetroAgent和SkillRL等系统相比,SkillRise通过单一模型实现任务执行与经验总结的双重功能,在保持同等性能的同时,将计算耗时降低至前者的1/6和1/4.3。这种端到端的设计显著提升了系统实用性。
框架的核心创新在于“去实例化”经验总结机制。在处理“将番茄放入微波炉”的任务时,AI不仅记录基本操作流程,更提炼出“检查目标容器是否可开启”的通用规则。这种抽象化处理使手册内容摆脱具体场景限制,当后续任务涉及冰箱、柜子等需要开门的容器时,AI可直接调用该规则。实验显示,这种技能迁移能力使模型在序列任务中的成功率随任务数量增加持续提升,在长度为6的任务序列中达到87.5%,较长度为2时提升3.9个百分点。
模型规模测试进一步验证了框架的普适性。在17亿参数的Qwen3-1.7B模型上,SkillRise即展现出显著优势,成功率超越基线3.1个百分点。当模型规模扩大至40亿参数时,其性能提升幅度达到7.8个百分点,较基线方法的提升幅度扩大近一倍。这表明框架能有效利用大模型的参数容量,在复合型学习任务中释放更大潜力。
该研究通过独特的双阶段训练机制,将任务执行反馈与经验总结反馈解耦。AI在执行任务时接收即时奖励信号优化操作策略,而手册质量评估则依赖后续任务完成情况。这种设计避免了传统多阶段系统常见的误差累积问题,确保技能总结始终服务于实际任务需求。研究团队开发的折扣反馈机制,使近期任务对手册更新的影响权重更大,进一步提升了经验迁移的时效性。
实验数据显示,在需要三次尝试才能成功的复杂任务中,SkillRise的Pass@3指标达到61.0%,较专门优化同任务多次尝试的LaMer方法高出14.2个百分点。这证明其积累的跨任务技能不仅能提升新任务处理能力,对同一任务的多次尝试同样具有指导价值。研究团队认为,这种泛化能力源于框架对任务本质特征的捕捉,而非对表面模式的记忆。
该成果为强化学习领域提供了新的研究范式。通过将任务序列设计与经验迁移机制相结合,SkillRise展示了在不依赖模型规模扩张的前提下提升AI智能水平的有效路径。其简洁高效的架构设计,为开发适用于复杂现实场景的通用人工智能系统提供了重要参考。相关技术细节已通过论文编号arXiv:2607.26784公开,供学术界和产业界进一步研究验证。











