ITBear旗下自媒体矩阵:

马里兰大学新突破:β-OPSD让AI像学生一样“步步为营”学推理

   时间:2026-08-12 03:35:05 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

马里兰大学帕克分校的研究团队在人工智能训练领域取得突破性进展,提出一种名为β-OPSD的新型训练框架。该研究以预印本形式发表于arXiv平台,论文编号为2607.28582。这项创新通过调整训练目标构造方式,显著提升了语言模型在数学推理任务中的表现,尤其在处理复杂逻辑问题时展现出更强的稳定性。

传统训练方法要求模型直接模仿教师模型的输出,如同学生被迫完全复制标准答案。这种模式在数学上对应于最小化KL散度,但研究团队发现这仅是更广泛策略中的特例。通过引入可调节参数β,新框架允许模型在训练过程中逐步向教师目标靠近,形成从"完全自我"到"完全模仿"的连续过渡路径。这种设计类似于教育领域中根据学生水平动态调整教学难度的理念。

技术实现层面,研究团队构建了包含参考版本和教师版本概率分布的几何插值模型。当β=1时,该模型还原为传统方法;当β增大时,训练目标更偏向保守策略。通过将logits层进行线性混合并配合softmax转换,团队成功解决了理论解中归一化常数计算复杂的问题,使新方法在工程实现上保持与传统方法相当的计算成本。

针对语言模型生成过程的序列依赖特性,研究团队改进了信用分配机制。传统方法仅用当前位置的局部误差更新模型,而新框架采用"回报到末端"加权策略,将后续所有位置的误差累积作为当前步骤的权重。这种设计使早期生成的词汇能够承担其对后续输出的影响责任,实验证明该改进在数学推理任务中带来显著提升。

在AIME 2024、AIME 2025和HMMT 2025三个数学竞赛基准测试中,β-OPSD展现出明显优势。对于17亿参数的Qwen3模型,新方法使平均正确率提升5.74个百分点;在40亿和80亿参数模型上,提升幅度分别为1.76和1.66个百分点。值得注意的是,这种提升未依赖额外训练数据或计算资源,仅通过优化训练目标构造实现。

消融实验验证了各组件的有效性。混合目标策略在三个基准测试中分别带来最高6.03、5.30和1.67个百分点的提升;回报到末端加权机制贡献了1.12至5.55个百分点的改进。动态学生模型与固定教师模型的组合被证明是最优配置,而混合比例从0.5线性递增至0.8的调度方案在多数测试中表现最佳。

研究团队还探索了混合采样策略,即在生成训练样本时同时参考学生和教师模型的概率分布。虽然该方案在特定参数下取得相近效果,但由于需要同时运行两个模型并引入重要性采样校正,最终选择保留学生在线采样的默认实现方式以保持训练效率。

这项成果为人工智能训练提供了新思路。通过将教育领域的渐进式学习理念转化为数学框架,研究团队证明了合理设计训练路径的重要性。对于17亿参数的小模型,这种平滑过渡的训练方式尤其有效,帮助其跨越与教师模型的能力差距。该方法已开放论文查询,详细技术细节可通过arXiv编号2607.28582获取。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version