ITBear旗下自媒体矩阵:

南洋理工等机构提出REDE框架:为AI推理链“降噪”提升检测精度

   时间:2026-08-07 05:50:14 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

人工智能领域正面临一个关键挑战:大型推理模型生成的冗长推理链中,大量无关或重复的“噪音步骤”严重干扰了幻觉检测的准确性。针对这一问题,南洋理工大学、浙江大学和悉尼科技大学的研究团队提出了一种名为REDE(推理去噪器)的创新框架,通过筛选关键推理步骤显著提升了幻觉检测的可靠性。

当前,像DeepSeek-R1和OpenAI o系列这样的模型在给出答案前会生成详细的推理链,但这些链条中混杂着大量无用信息。研究团队发现,这些噪音步骤分为两类:一类是完全无关的推理内容,另一类是语义重复的冗余步骤。在分析美国数学邀请赛(AIME 2024)题目生成的推理链时,研究人员标注发现,重复步骤占比高达48.8%,无关步骤占24.1%,而真正有价值的步骤仅占27.1%。当手动删除这些噪音步骤后,幻觉检测准确率提升了13.73%,这直接证明了清理推理链的必要性。

传统过滤方法存在根本性局限。研究人员尝试利用模型置信度区分有用步骤和噪音步骤,但实验显示两者的置信度分布几乎完全重叠。基于嵌入空间的相似度过滤方法对无关步骤有一定效果,却无法识别重复步骤——因为这些步骤在语义上与有效步骤高度相似。这表明需要更精准的信号来衡量推理步骤对最终答案的贡献。

研究团队转向模型内部的注意力机制寻找解决方案。在生成最终答案时,模型会对推理链中的每个步骤分配不同的注意力权重,这些权重反映了步骤对答案的重要性。通过计算最终答案词与推理步骤词的内积并归一化,研究人员定义了“步骤分数”来量化这种贡献。实验表明,有效步骤的平均注意力分数(0.0065)显著高于无关步骤(0.0021)和重复步骤(0.0033)。进一步研究发现,在语义相似的步骤组中,保留最后出现的步骤比保留最早出现的步骤能使幻觉检测准确率提升11.46个百分点。

基于注意力分数的发现,研究团队设计了REDE框架的三阶段流程。首先,采用困惑度加权平均方法提取每个步骤的向量表示,使关键信息获得更高权重。其次,构建代理集合训练投影网络:将注意力分数最高的前20-25%步骤作为有效代理,最低的20-25%作为噪音代理,通过三个损失函数训练两层MLP网络,使有效步骤在新空间中紧密聚集,噪音步骤保持分散,两组之间保持最大距离。最后,在推理阶段,将步骤向量通过训练好的网络变换后,用k近邻距离衡量孤立程度,删除距离最大的前70%步骤,保留核心30%进行幻觉检测。

实验验证了REDE的广泛适用性。在涵盖常识问答、数学推理、代码生成和多跳问答的四个数据集上,REDE与四种代表性检测方法结合使用时,所有组合的检测效果均优于原始推理链。以Qwen3-8B模型在TruthfulQA数据集上的表现为例,对比一致性搜索方法的AUROC指标从68.63%提升至87.32%,监督式探针从80.42%提升至86.44%。与专门为推理模型设计的ARS方法相比,REDE在MATH数据集上实现了81.33%对77.03%的优势。迁移能力测试显示,在MULTIHOPQA上训练的投影网络直接应用于CodeElo数据集时,AUROC达到88.04%,甚至略高于在该数据集上训练的87.19%。

消融实验证实了REDE设计的每个环节都至关重要。去除分散损失导致AUROC下降6.38个百分点,证明防止噪音步骤聚集是关键;过滤比例实验显示,删除70%步骤时性能达到峰值,与人工标注的73%噪音比例高度吻合;步骤嵌入方式比较中,困惑度加权平均在所有检测方法下均表现最优。直接使用注意力分数过滤的对比实验表明,REDE通过学习投影网络的方式比直接阈值切割更稳健有效。

研究团队还提供了严格的数学证明,构建了从训练目标到几何结构再到检测性能的完整逻辑链。理论分析表明,噪音步骤会降低推理链的Fisher判别度,而REDE学习的新空间能够统计区分有效步骤和噪音步骤的k近邻距离。当过滤错误率趋近于零时,过滤后推理链的检测风险将趋近于纯净有效步骤的检测风险,为REDE的有效性提供了坚实理论基础。

针对黑盒模型场景,研究团队提出了代理模型方案。使用Qwen3-32B作为代理,通过其注意力和嵌入信息对目标模型生成的推理链进行过滤,在所有测试场景下均优于原始推理链。在DeepSeek-R1-Distill-Llama-8B的TruthfulQA测试中,代理方式达到59.85%的AUROC,与白盒场景的61.94%差距较小,显示了REDE的跨模型迁移能力。

这项研究为提升AI可靠性提供了新思路:不是减少模型思考,而是帮助其筛选真正关键的推理步骤。REDE框架作为可插拔模块,能够与现有幻觉检测工具无缝集成,为提升人工智能系统的可信度提供了实用解决方案。完整技术细节可查阅arXiv编号2607.22098的论文。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version