人工智能语言模型训练中,一个长期存在的难题是模型在推理过程中容易“一错到底”——一旦某个中间步骤出错,后续推理便会基于错误前提不断累积偏差,最终导致结果完全偏离正确方向。浙江大学与阿里巴巴集团优音团队联合提出了一种名为“接力式在线蒸馏”(Relay On-Policy Distillation,Relay-OPD)的创新训练方法,通过引入“教师-学生”接力机制,在模型即将走偏时由更强大的教师模型短暂接管推理过程,及时纠正方向后再交还控制权,有效解决了这一顽疾。
传统训练方法中,最常见的模式是让学生模型直接模仿教师模型生成的“范文”,但这种方法存在根本缺陷:学生只能复现已知路径,面对未见过的新问题便会手足无措。更先进的“在线蒸馏”技术虽让学生自主解题并接受教师实时指导,却因“前缀失败”问题陷入困境——当学生模型在早期步骤出错后,后续推理会基于错误前提展开,教师模型面对离谱的上下文给出的指导也会逐渐失效,甚至产生误导。
研究团队通过深入分析发现,在推理走偏的关键节点,教师模型与学生模型对下一步的选择存在显著分歧:学生倾向于用“所以”等连接词延续错误方向,而教师更可能用“但是”“等等”等反思性词汇暂停并重新审视。例如在一道水果购买问题中,学生模型错误计算剩余金额后得出“可再买1个芒果和1个木瓜”的结论,此时教师模型选择“But”的概率高达74.4%,而学生选择“So”的概率达50.6%。这种偏好差异成为判断是否需要介入的关键信号。
基于这一发现,研究团队设计了三阶段接力机制:首先通过预设的反思词列表(如“Wait”“However”等)构建“换手触发器”,当教师模型倾向使用反思词而学生模型未考虑时触发介入;随后教师模型生成包含正确推理的段落(平均每段23.2词)后交还控制权,并通过“接力预算”限制单次训练轨迹中的介入次数;最终在混合学生与教师生成内容的轨迹上,优化学生模型向教师分布靠拢,使纠正性推理成为直接学习样本。
工程实现上,研究团队创新地将接力过程整合到“投机解码”引擎中:学生模型作为草稿模型生成候选词,教师模型作为目标模型验证并替换不符合分布的词汇。这种设计不仅实现了无缝切换,还让教师模型在验证过程中自然计算出触发换手所需的信息,无需额外计算开销。实验显示,1.7B参数的学生模型训练轨迹长度从标准方法的4658词压缩至2296词,训练步数从55步减少至35步,计算资源消耗大幅降低。
在AIME、MATH500等八个数学竞赛基准测试中,Relay-OPD展现出显著优势:1.7B学生模型平均准确率达46.96%,较标准在线蒸馏提升5.73个百分点,较最强竞品FastOPD提升1.49个百分点;在AIME 2025等最难题目上,准确率提升幅度超过7个百分点。0.6B学生模型同样实现3.01个百分点的提升。更关键的是,该方法训练出的模型在推理阶段生成的答案更简洁——在AIME 2025测试中答案长度较FastOPD缩短17.9%,同时保持更高准确率。
对比实验揭示了Relay-OPD的核心优势:传统“轨迹重写蒸馏”因生成不自然的修改痕迹导致效果恶化;逐词介入的“投机知识蒸馏”无法打破重复错误循环;硬截断的FastOPD虽缩短轨迹却未传授纠错能力。而Relay-OPD通过智能截断与示范结合,既避免了错误内容的干扰,又让学生模型学会了“遇到错误时如何反思调整”,这种“点到为止”的介入哲学被证明既高效又有效。
研究团队通过动态追踪发现,随着训练推进,学生模型触发换手的比例从75%-85%降至50%-60%,教师词占比稳定在2%-3%,表明模型自主纠错能力持续提升。消融实验进一步验证了设计选择:教师生成的纠正性内容本身带来2.77个百分点的提升,选择性吸收教师信号的策略优于全面模仿教师分布。超参数敏感度分析显示,教师介入段落长度(L)设为3、接力预算(M)设为2、学生候选词数量(K)设为5时效果最佳。
尽管当前研究主要聚焦数学推理任务且使用特定模型配对,但接力机制的设计原理具有普适性。研究团队指出,该方法在代码生成等其他领域的应用潜力有待验证,反思词列表可能需根据任务特点调整,且当教师与学生能力差距较小时介入价值会降低。这项工作为资源受限条件下的AI训练提供了新思路:通过精准的少量介入,让小模型不仅学会正确答案,更掌握“发现错误时如何调整”的元能力。









