上海交通大学与上海人工智能实验室联合发布了一项突破性研究,提出了一种名为“双锚点策略蒸馏”(DAPD)的新型训练框架,旨在解决大型语言模型在训练过程中出现的“编答案”现象。这种现象表现为模型在解题遇到困难时,会直接声称知道答案,并基于这一未经推导的结论编造推理过程,而非通过真正的逻辑推导得出答案。
研究团队将这一现象形象地称为“特权幻觉”,指出其根源在于训练过程中模型对参考答案的过度依赖。在一种名为“在线策略自蒸馏”(OPSD)的先进训练方法中,模型同时扮演“参考老师”和“实际考试”两个角色。前者能看到参考答案,后者则不能。理想情况下,老师版本应指导学生版本学习如何独立推理,但实际训练中,学生版本逐渐学会了模仿老师“已知答案”的推理方式,导致在独立推理时也表现出“知道答案”的幻觉。
为量化这一问题,研究团队设计了“错误断言”检测器,发现随着OPSD训练的进行,模型生成错误断言的频率显著上升,同时在高难度数学竞赛题上的正确率下降。例如,在Qwen3模型上,错误断言从每万次生成约13次增至37次,AIME竞赛平均分从59.56分跌至53.24分。
进一步分析表明,问题的核心在于“老师”和“学生”版本之间的信息不对等。老师版本因能看到答案,其推理隐含“已知终点”的前提;而学生版本在实际使用时缺乏这一信息,却被迫模仿老师的推理方式,导致“蒙眼走路却假装能看见”的矛盾行为。研究团队通过对照实验验证了这一诊断:当学生版本也能看到自己生成的完整答案时,错误断言减少45%,推理正确率提升6.22分。
实验结果显示,DAPD在六项测试中均优于OPSD。在Qwen3-4B模型上,DAPD平均得分57.34分,较OPSD提升2分;在AIME25和HMMT25数学竞赛中分别提升4.44分和3.06分,编程任务BFCL v3提升0.59分。规模扩展实验进一步证明,DAPD在大模型上的优势更显著:OPSD在8B至32B模型上几乎失效,而DAPD在32B模型上仍提升3.06分。
以一道AIME24题目为例,OPSD训练的模型在推导卡壳后直接断言答案为“36/7”,导致错误;而DAPD训练的模型通过建立方程逐步推导出正确答案“127”。DAPD在训练领域外的泛化能力也更强:用纯数学数据训练的模型在编程任务上得分比OPSD高4.82分,表明其学到了更通用的推理能力。
针对参考答案依赖问题,研究团队还探索了“双rollout”变体,即让模型生成两个独立答案,分别作为“参考侧”和“rollout侧”进行训练。实验表明,即使没有外部参考答案,该方法在1.7B至8B模型上仍能提升0.46至2.41分。若进一步筛选正确答案作为参考,4B模型得分可达66.11分,较未筛选方案提升1.11分。
这项研究为提升大型语言模型的推理可靠性提供了新思路。DAPD框架通过解决“特权幻觉”问题,使模型在数学推理、代码生成等任务中输出更可信的结果。其训练方法不增加推理成本,仅需在训练阶段维护更多分布视角,具有较高的实用价值。目前,研究团队已公开论文(arXiv编号2608.01735),并指出未来可探索将框架延伸至搜索引擎文档、代码执行结果等其他特权信息场景。











