ITBear旗下自媒体矩阵:

AI训练新突破:Agon框架以"竞赛思维"破解推理能力提升难题

   时间:2026-07-31 02:52:55 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在人工智能领域,如何让模型学会高效推理而非堆砌冗长答案,一直是困扰研究者的难题。近期一项由独立机构thinkdense.ai发布的研究,通过构建名为Agon的竞争框架,为解决这一难题提供了全新思路。该研究以预印本形式公开,论文编号为arXiv:2607.07690,在极难数学题数据集DeepMath-hard上的实验显示,小模型经过该框架训练后,解题正确率提升幅度超过30个百分点,同时推理文本长度显著缩短。

传统强化学习训练中,模型往往通过"结果导向"的方式学习——系统仅根据最终答案正确性给予奖励或惩罚,忽视推理过程的质量。这种训练方式导致模型为提高正确率,倾向于生成大量试探性内容,形成"废话多但能力弱"的困境。研究数据显示,采用标准GRPO训练的模型,文字输出量膨胀近十倍,正确率提升却不足10%。麻省理工学院等机构此前研究也证实,缺乏外部反馈的自我纠错机制效果有限,模型难以发现自身推理中的固有盲点。

Agon框架的核心创新在于引入双模型竞争机制。研究者训练两个共享基础模型的LoRA适配器,通过角色轮换实现"解题-评估"的动态交互:每轮训练中,模型A先生成解题摘要(隐藏最终答案),模型B在参考摘要的基础上完成解题。若模型B在模型A错误时答对题目,将获得额外"转化奖励"。这种设计使模型B隐式评估对手推理质量——当模型A的步骤存在漏洞时,模型B通过正确解题间接暴露问题,系统通过竞争结果自然惩罚错误推理,无需人工标注步骤优劣。

奖励机制的设计是该框架的关键突破。研究者摒弃简单的"胜负加分"模式,采用乘法结构奖励:仅当挑战者答对且对手答错时触发额外奖励。这种设计将竞争压力直接关联挑战者自身的正确性,避免因对手表现引入噪声干扰。实验表明,若挑战者面对固定难度的对手(如8次尝试均参考同一错误答案),奖励信号将因标准化处理失效;而对手难度动态变化时,转化奖励能形成有效梯度,引导模型聚焦对手薄弱环节。

工程实现上,该框架通过参数高效微调技术控制成本。两个LoRA适配器仅占基础模型2%的参数量,共享冻结的基础网络大幅降低内存开销。初始状态的随机扰动与角色轮换机制,确保模型逐渐形成差异化思维模式。在DeepMath-hard数据集测试中,Agon框架使0.6亿参数模型的正确率从23%跃升至61%,推理文本长度从8100字压缩至3500字。相比之下,标准GRPO训练的4亿参数模型正确率仅为59%,且输出更冗长。

该框架的普适性通过多领域实验得到验证。在竞争性编程任务中,Agon使代码生成单元测试通过率从24%提升至34%,推理长度同步缩短;在GSM8K初中数学题集和MATH-500高中综合题集的迁移测试中,训练后的模型正确率分别提升13%和19%,证明其提升的是泛化推理能力而非数据过拟合。规模测试显示,模型参数越小,框架带来的提升越显著——0.6亿参数模型提升31个百分点,而4亿参数模型仅提升12个百分点。

研究团队同时指出框架的现存局限:当前实现依赖自动验证器判断答案对错,难以直接应用于写作等开放性任务;双模型互补性仅通过训练假设维持,未进行量化验证;所有实验均为单次运行,结果存在随机波动风险。当前推理需两阶段串行执行,完整算力消耗尚未精确核算。针对这些挑战,研究者提出两大改进方向:一是探索模型间通过隐状态(而非自然语言)交换信息,突破语言带宽限制;二是研究"密度调节"机制,在保持准确率的同时进一步压缩推理长度——实验显示,通过奖励更简洁的正确解答,可将推理文本再压缩至2600字。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version