ITBear旗下自媒体矩阵:

南京大学与字节跳动创新研究:让AI训练告别“平均主义”更精准

   时间:2026-08-08 00:33:59 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在人工智能语言模型训练领域,一项由国内高校与科技企业联合完成的研究提出了创新方法,有效解决了传统训练方式中存在的“平均分配奖励”问题。该方法通过引入“反事实重播”机制,使模型能够更精准地识别并强化对任务要求至关重要的词汇,从而提升复杂指令的遵循能力。

当前主流的大语言模型训练中,强化学习技术通过让模型生成多个回答并比较评分来优化策略。然而,传统方法将整体评分奖励均匀分配给回答中的每个词汇,导致关键格式符号或特定要求词汇与普通内容词汇获得同等激励。这种“平均主义”训练方式浪费了评分细则中的结构化信息,限制了模型对复杂指令的理解能力。

研究团队提出的CoRT方法通过对比实验破解了这一难题。该方法的核心在于保持其他条件不变的情况下,移除评分细则要求后重新计算生成词汇的概率值。通过比较有/无评分细则两种情境下的概率差异,系统能够量化每个词汇对任务要求的依赖程度。例如,在要求使用Markdown格式的回答中,项目符号“*”的概率差值显著高于普通内容词汇,表明其高度依赖评分细则。

技术实现上,CoRT采用三阶段处理流程:首先通过常规强化学习生成候选回答;其次在移除评分细则的对照提示下,重新计算每个词汇的对数概率;最后通过sigmoid函数将概率差值压缩为0-1区间的“重播边际得分”,并转换为词级别权重。这些权重与原始优势值结合,形成带信用权重的训练信号,使关键词汇获得更强的优化激励。

实验数据显示,该方法在多个基准测试中取得显著提升。在40亿参数模型测试中,指令级准确率从84.29%提升至86.06%,多维度约束准确率提高6.1个百分点;70亿参数模型在相同测试中更实现11.85个百分点的跃升。值得注意的是,该方法在140亿参数规模模型上依然保持有效性,且无需额外训练判别模型,相比需要专门标注数据的RTT方法具有更低实现成本。

为确保训练稳定性,研究团队设计了渐进激活机制。在训练初期保持较低词级权重影响,待模型策略稳定后逐步增强关键词汇的激励力度。这种动态调整方式有效避免了早期训练震荡,同时保证了后期优化精度。实验表明,移除归一化或渐进激活组件均会导致梯度不稳定或生成文本截断比例上升。

针对模型通用能力的担忧,测试结果显示该方法未对数学推理、科学知识等基础能力产生负面影响。在三个通用能力基准测试中,经过优化的模型得分与原始版本持平,部分指标甚至略有提升。这表明通过精准分配训练奖励,模型能够在保持基础能力的同时,显著提升复杂指令的遵循精度。

该研究通过重新利用模型自身的生成概率信息,开创了无需额外标注的词级信用分配方案。其核心思想不仅适用于强化学习训练,还可扩展至多轮对话、工具调用等复杂场景的优化。研究团队已公开技术细节,为提升人工智能系统的指令理解能力提供了新思路。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version