ITBear旗下自媒体矩阵:

南开北理工等团队新突破:蒸馏强化学习让AI“进化”更高效智能

   时间:2026-07-31 03:12:29 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

人工智能助手在编写代码、解答数学题、应对复杂问题等方面展现出越来越强的能力,其背后的“进化”逻辑与人类学习存在相似之处——要么通过反复试错自我提升,要么借助更强大的模型获取指导。然而,这两种传统路径均存在显著缺陷:自我强化的模型容易陷入局部最优解,难以突破能力边界;直接模仿强大模型的模型则可能因过度拟合而丧失创新性,尤其在两者架构差异较大时效果更差。针对这一难题,由多所高校及科研机构组成的联合团队提出了一种名为“蒸馏强化学习”的新框架,相关研究以预印本形式发表于学术平台,论文编号为arXiv:2607.17247。

传统方法中,强化学习通过环境反馈调整策略,类似于学生通过考试结果判断对错,但无法定位具体错误步骤;在线蒸馏则要求模型逐词模仿教师模型的输出,如同学生机械复制教师的解题步骤。实验表明,在线蒸馏在训练初期进步迅速,但很快因教师与学生分布差异导致性能崩塌,尤其在跨架构场景下更为明显;强化学习虽能持续进步,但效率较低。研究人员通过对比实验发现,单纯叠加两种方法无法解决根本问题,增加采样次数也未能改善瓶颈,表明问题根源在于模仿机制本身的设计缺陷。

新框架的核心创新在于将教师指导转化为“条件性辅助”而非“强制性复制”。其运作机制可类比围棋教学:学生先独立对弈,若整局棋被判定为优质对局,则参考教师的每一步偏好进行精细化调整;若整局棋表现不佳,则仅依赖原始奖惩信号,避免教师偏好干扰错误判断。这一设计通过三个关键技术实现:反向重要性采样通过计算教师与学生旧版本的偏好差异比值,动态调整词级权重;负样本重置在回答整体错误时将教师权重归一化,防止错误方向上的过度惩罚;序列级几何归一化通过校正词级权重的几何平均数,消除教师与学生模型因规模差异导致的信号扭曲。

为验证知识传递的有效性,研究团队设计了一项温度控制实验:以模型自身为教师,通过调节温度参数控制其选词随机性,当学生熵值高于阈值时降低温度以增强确定性,低于阈值时升高温度以提升灵活性。实验结果显示,采用新框架的学生熵值能精准跟随教师温度信号波动,而移除负样本重置后,学生熵值始终偏离目标值,证明该环节对过滤错误指导至关重要。在跨架构蒸馏场景中,新框架将15亿参数学生模型的综合得分从31.70分提升至40.00分,显著优于传统方法;同架构场景下亦实现稳定提升,且训练过程中策略熵值保持适中,回答长度稳定,未出现异常波动。

消融实验进一步验证了各组件的必要性:移除负样本重置导致性能下降幅度超过完全不用教师指导,移除几何归一化则使两个学生模型得分分别下降1.24分和1.47分。研究团队同时指出,当前方法仍存在局限性——教师模型仅评估学生答案而非主动解题,可能导致在部分学生已超越教师的领域提供错误指导。未来改进方向包括引入教师能力评估机制,根据其建议一致性动态调整参考权重,或通过多教师协同指导提升鲁棒性。

该研究为AI训练提供了新范式:通过条件性引入教师指导,在保持学生探索能力的同时实现知识的高效传递。对于资源有限的中小规模模型而言,这一方法使其能借助更大模型的知识提升推理能力,推动AI技术向更普惠的方向发展。技术细节可查阅论文arXiv:2607.17247。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version