ITBear旗下自媒体矩阵:

AI训练新突破:进化策略助力长任务,低显存也能高效微调

   时间:2026-09-17 22:36:45 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

训练一个能连续操作浏览器完成复杂任务的AI智能体,究竟需要多少张显卡?如果任务仅需回答单个问题,几张显卡或许足够;但若涉及点击、输入、翻页、判断等数十个步骤,传统强化学习方法可能需要几十张显卡才能完成训练。然而,最新研究显示,通过优化训练策略,显存需求可大幅降低至传统方法的十分之一。

新加坡国立大学、南方科技大学与牛津大学的研究团队在论文《Agentic ESOpt》中提出,当AI智能体面临长序列复杂任务时,传统强化学习训练方式可能并非最优解,甚至可能失效。取而代之的是一种被称为“进化策略”的古老方法——尽管该方法在过去被认为效果逊色于强化学习,但在处理长任务时却展现出显著优势。

长任务为何让强化学习陷入困境?以浏览网页获取信息为例,这类任务需要AI模型与外部环境反复交互数十次才能完成。传统强化学习通过“反向传播”调整模型参数,但这一过程需存储大量中间计算结果,导致显存需求随任务长度激增。例如,在数独任务中,微调一个40亿参数的模型,GRPO算法需58.88GB显存,PPO算法更需89.4GB,而仅用于推理的显存需求仅为8.41GB。显存消耗的差异,主要源于反向传播过程中对激活值和优化器状态的存储需求。

更棘手的问题在于“信度分配”——当任务需连续执行十几个动作才能判断成败时,系统难以精准定位具体哪一步出错。例如,导航系统仅在到达终点或迷路时给出反馈,中间十几个转弯路口均无提示。若最终未到达目的地,系统无法判断是第三个路口转错,还是第十二个路口失误。这种模糊性导致强化学习在长任务中的调整方向可靠性随任务长度增加而下降。

研究团队提出的解决方案是回归进化策略。该方法不依赖梯度计算,而是通过在当前参数附近随机生成多个“扰动方向”,让每个扰动版本的模型独立执行任务并获得评分,最终根据评分调整参数。例如,若当前模型参数为θ,系统生成32个随机噪声方向,分别加到θ上得到32个变体模型。每个变体完成任务后获得评分,系统根据评分对参数进行加权更新。由于仅需存储随机数种子而非完整变体模型,270亿参数的模型训练仅需4张H100显卡,显存需求与纯推理相当。

进化策略的优势源于其数学结构。传统强化学习需将最终奖励拆分到每个动作上,导致方差随任务长度线性增长;而进化策略仅针对整条轨迹采样一个扰动方向,评估结果后更新参数,避免了逐动作拆分带来的噪声累积。这一特性使其在长任务场景中表现更稳定。例如,在可控最短成功步数的数独实验中,当任务步数从5步增加至15步时,PPO算法成功率从90.63%骤降至0%,GRPO算法从67.71%降至40.63%,而Agentic ESOpt仍保持53.13%的成功率。

实验进一步验证了进化策略的实用性。在数学推理任务中,Agentic ESOpt使模型在AIME 2026竞赛测试集上的准确率提升15个百分点;在文档问答任务中,DocVQA数据集上的准确率提升12.3个百分点。更关键的是,该方法未牺牲答案多样性——在Pass@K指标(衡量模型在K次尝试中至少答对一次的概率)上,Agentic ESOpt在所有报告中均优于GRPO配置,表明其拓宽了模型的成功解题范围。

在网页操作智能体WebArena-Lite测试中,Agentic ESOpt将270亿参数模型的任务成功率从29.47%提升至36.16%。研究团队还尝试将其与提示词优化方法Trace2Skill结合,发现两者可协同工作:Trace2Skill通过优化操作手册减少已知错误,Agentic ESOpt通过调整模型参数提升基础能力,最终使成功率进一步提升至36.36%。

进化策略的价值不仅限于训练阶段。在自动启发式设计任务中,研究团队将其嵌入到EoH框架(一种通过交叉、变异生成决策代码的算法)中,通过在变异操作中插入参数扰动,使旅行商问题、背包问题等测试集上的性能显著改善。这表明进化策略可作为轻量级黑箱优化工具,嵌入到现有搜索流程中,仅需一个返回评分的接口即可运行。

研究还发现一个有趣现象:模型能力越强,所需扰动种群规模越小。在数独任务中,40亿参数模型将种群数量从8增至16时,成绩提升677%;而90亿参数模型的成绩几乎无变化。这可能因为能力更强的预训练模型参数邻域更“可靠”,少量扰动即可找到有效更新方向;而能力较弱的模型需更大范围探索才能避开“陷阱”。

尽管成果显著,该方法仍存在局限性。例如,进化策略引入了新的超参数(如扰动幅度σ),需额外调优;在评估成本高昂的场景中(如真实物理实验),多轨迹评估可能不划算;长期连续学习中的参数更新方向性仍需进一步验证。研究团队回应称,在WebArena实验中,96.26%的参数更新幅度集中在扰动尺度内,未出现失控漂移,但该问题尚未彻底解决。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version