ITBear旗下自媒体矩阵:

AI多任务学习为何陷入“偏科”困境?上海团队GEPO策略破局有招

   时间:2026-07-31 03:04:58 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

上海人工智能实验室的研究团队在大型语言模型训练领域取得重要进展,其提出的“组熵控制策略优化”(GEPO)方案有效解决了多任务训练中的偏科问题。该研究以预印本形式发布于arXiv平台,编号为arXiv:2607.16850v1,在十三个基准测试中展现出显著优势。

现代AI模型需同时掌握数学推理、代码生成、科学问答等多样化能力,但传统训练方法常导致模型在简单任务上过度强化,复杂任务探索不足。研究团队通过实验发现,不同类型任务的熵值存在显著差异:物理题平均熵值0.49,数学题0.60,而指令遵循类任务高达0.78。这种差异使得标准化激励信号在低熵任务上产生极端强化效应,在高熵任务上则形成微弱且嘈杂的反馈,最终形成“强者愈强”的恶性循环。

现有主流算法GRPO通过答案标准化处理构建激励信号,但研究团队指出其存在根本性缺陷:当不同任务熵值差异显著时,标准化分数分布会被策略分布系统性扭曲。数学推导显示,低熵任务中正确答案的激励强度可达√((1-p)/p),当正确率p=0.16时,激励强度会爆炸性增长至2.5倍,而错误答案仅受到0.4倍的微弱惩罚。这种失衡导致模型将70%以上的训练资源集中在低熵任务,高熵任务的有效训练时间不足30%。

GEPO方案通过动态熵调节机制破解这一难题。该方案在GRPO框架内引入三重创新:首先计算每组答案的“组熵”指标,通过除以平均答案长度实现跨任务公平比较;其次建立不对称干预机制,对低熵任务削弱20%正向激励,对高熵任务减轻50%负向惩罚;最后设计自适应阈值系统,以均值±标准差动态划分熵区间,并通过指数移动平均(γ=0.01)确保阈值稳定演变。整个过程无需额外计算或数据标注,完全基于训练过程中已生成的答案样本。

实验数据显示,在Intern-S1-mini模型上,GEPO使AIME25数学竞赛成绩从74.6提升至82.0,IMO-Bench从42.3提升至52.8,指令遵循任务准确率提高12%。在Qwen3.5-9B模型测试中,GEPO不仅将综合得分从70.7提升至71.2,更彻底解决了GRPO在170步训练时发生的灾难性崩溃问题。消融实验证实,高熵控制组件贡献最大,移除后综合得分下降2.9分,低熵控制和不对称设计分别贡献1.6分和1.2分。

该方案的核心价值在于实现了真正的“任务感知”训练。通过保留不同任务间的合理熵差异,GEPO使模型在数学推理等强项上保持适度强化,在物理建模等中等难度任务上维持探索活力,在指令遵循等高熵任务上获得充分试错空间。这种动态平衡机制特别适用于多模态大模型训练,能有效避免“数学强、写作弱”的偏科现象。

技术细节显示,GEPO的自适应阈值系统具有强鲁棒性。在Qwen3.5-9B训练中,该系统自动将低熵阈值设定为0.38(均值0.42-0.04标准差),高熵阈值设定为0.57(均值0.42+0.15标准差),精准区分不同任务状态。对比固定阈值方案,这种动态调整使模型在训练后期仍能保持23%的有效探索率,而固定阈值方案在该阶段探索率不足8%。

对于普通用户而言,这项突破意味着AI服务将更加均衡可靠。经过GEPO训练的模型在处理混合任务请求时,能合理分配计算资源,既保证数学计算的精确性,又维持文本生成的创造性。研究团队强调,该方案可直接集成到现有强化学习框架,计算开销增加不足3%,为工业界训练超大规模模型提供了可行路径。完整技术方案详见arXiv论文,包含所有数学推导和实验数据。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version