在人工智能训练领域,医疗问答场景一直是个棘手难题。当用户询问“这个孩子的症状最可能是什么病”时,理想的AI助手应给出基于多维度考量的专业回答,而非简单猜测。然而,训练这样的AI远比教它解数学题复杂得多——数学答案的对错一目了然,而医学建议的优劣需从症状识别、检查手段推荐、危险操作规避等多个维度综合评判,无法用单一标准衡量。
为攻克这一难题,浙江大学与字节跳动联合研究团队提出“基于标准的蒸馏策略优化”(CriPO)方法,通过创新训练机制将模型效率提升一倍。该研究以预印本形式发布,论文编号为arXiv:2607.18082,为开放性任务训练提供了新思路。
传统强化学习通过试错机制训练AI,类似训练小狗做对给奖励、做错无奖励。这种方法在数学或编程等任务中效果显著,因答案具有唯一性。但在医疗问答等场景中,答案质量取决于多维度标准,如是否识别主要疾病、是否建议合适检查、是否提醒避免有创操作等。为此,研究者引入评分标准(Rubric)训练法,将好回答拆解为具体指标并打分,用总分指导AI学习。然而,这种看似合理的方法存在两个隐蔽缺陷。
第一个缺陷是“未被探索的标准”。在强化学习训练中,AI每次生成多个回答后通过对比学习。若某批回答均未满足某条评分标准,该标准便无法产生学习信号,导致AI无法感知自身不足。例如,若所有回答都未引用文献,老师便无法针对这一点打分,该考察点形同虚设。研究显示,使用Qwen3-4B模型训练医学任务时,超83%的训练样本存在此类问题,平均每个样本有2.5条标准未被探索,且该问题贯穿训练全程。
第二个缺陷是“被压制的标准”。训练时,AI通过计算回答相对于平均水平的偏差(即“优势”)来学习。若某回答在某条标准上表现优异,但其他方面糟糕导致总分低、优势为负,AI会因整体劣势而惩罚该正确行为。例如,若8个回答中仅2个建议腹部X光检查,但这两者在其他方面表现差导致总分低,AI会错误学习到“不应建议腹部X光”。统计显示,超57%的训练样本存在此类问题,平均每个样本有1.8条标准被压制。
针对“未被探索的标准”,研究团队设计“行为注入机制”。当发现某条标准未被满足时,系统构建“标准注入辅导老师”,在最佳回答基础上针对缺失标准做最小幅度修改,并精准定位差异词位置,通过正向KL散度引导学生模式AI吸收关键信息。实验表明,仅约34.6%的词位置贡献了95%的差异量,其余为无意义扰动,该机制有效过滤噪音,提升学习精准度。
针对“被压制的标准”,团队提出“优势翻转机制”。当某回答因整体劣势导致正确行为被惩罚时,系统构建“反事实辅导老师”,通过删除或修改被满足标准对应的内容,定位承载该标准的关键词,并将这些词位置的优势值从负数翻转为小正数(默认0.1)。此操作保留有用行为,同时维持对其他问题的正常惩罚。
CriPO方法的核心创新在于“在线自我蒸馏”:同一AI模型以“学生模式”和“辅导老师模式”双模式运行。学生模式正常生成回答,辅导老师模式基于评分标准提供纠正信号,两者通过模仿学习保持训练与使用环境一致,避免“训练推理不匹配”问题。研究团队将自我蒸馏作为辅助模块叠加在原有强化学习框架(GRPO)上,既保留主干稳定性,又发挥蒸馏优势。
实验结果显示,在医学问答和科学问答领域,使用Qwen3-1.7B和Qwen3-4B模型的测试中,CriPO方法显著优于标准GRPO和已有方法。例如,Qwen3-1.7B模型上,GRPO平均分为59.2,CriPO达62.4;Qwen3-4B模型上,GRPO为68.2,CriPO达69.6。更关键的是,CriPO仅需约175步训练即可达到GRPO 200步的水平,训练效率提升近一倍。CriPO未破坏模型通用能力,在指令跟随类基准测试中表现与原始模型持平。
训练过程观察进一步验证CriPO有效性。其奖励曲线始终高于GRPO,且爬升更快更稳;熵值(反映模型探索多样性)更高,尤其是行为注入版本;优势翻转版本训练的模型回答更长且包含更深入推理。例如,面对早产儿血便问题,GRPO模型选择错误的内镜检查答案,仅满足一项标准;CriPO模型则系统识别坏死性小肠结肠炎风险,解释腹部X光首选原因,并明确内镜不适合理性,同时满足五项标准。
消融实验证明CriPO设计合理性。行为注入模块中,若不选择最佳回答或不对差异词位置精准学习,分数分别下降0.8和0.9;优势翻转模块中,若随机翻转词位置优势而非精准定位,分数大幅下降4.0。这些结果表明,每个设计细节均对方法效果至关重要。










