在人工智能应用日益广泛的今天,一个困扰行业已久的难题终于迎来突破性进展。芬兰阿尔托大学计算机科学团队提出全新解决方案,将视觉语言模型的"归因幻觉"率从最高97%大幅降至28%,同时使证据召回率突破50%大关。这项发表于arXiv平台的研究(编号2607.24651v1),为AI在医疗、法律、金融等高风险领域的可信应用开辟了新路径。
研究团队发现,当前主流模型普遍存在"答对找错"的荒诞现象:当询问技术文档中接触针材料时,模型虽能正确回答"磷青铜",却将证据框标注在完全无关的页面区域。这种被定义为"归因幻觉"的缺陷,源于要求语言模型执行超出其能力范围的坐标定位任务——就像让文学家进行精密几何测量,本质上是接口设计存在根本性缺陷。
实验数据揭示了问题的严重性:在CiteVQA基准测试中,六款主流模型在坐标输出模式下的证据召回率最高仅8.1%,最低甚至只有0.3%。更令人震惊的是,310亿参数的顶级模型在三分之二情况下直接放弃坐标输出,转而用语言描述位置信息,这暴露出模型对坐标接口的天然抗拒。
研究团队提出的替代方案彻底改变了游戏规则。新系统要求模型不再输出坐标数字,而是直接引用原文关键片段,如"第十二条第三款写道:乙方须在收到通知后三十日内……"。随后通过三阶段流程实现精确定位:首先用MinerU工具将文档分割为语义块,再通过Qwen3-VL-Embedding-2B编码器生成数字指纹,最后运用匈牙利算法完成最优匹配。这种设计将空间定位任务转移至专业检索系统,使AI得以专注内容理解。
对比实验验证了方案的有效性。在相同模型和输入条件下,语言接口使证据召回率飙升至25.9%-46.9%,同时保持答案质量稳定。特别值得注意的是,新方法彻底解决了坐标接口的精度衰减问题——当IoU阈值从0.1提升至0.7时,召回率始终维持在39%-42%区间,而坐标接口在此过程中准确率归零。
研究团队通过拆解实验揭示了关键机制:单纯优化坐标精度无法解决根本问题,真正起作用的是AI生成的语言引用与多模态检索的协同作用。实验显示,引用检索与问题+答案检索的联合召回率达51.9%,其中引用贡献了11.1个百分点的额外覆盖,证明两种定位信息具有显著互补性。
在训练优化方面,研究团队开创了无需区域标注的强化学习方案。通过GRPO算法让模型生成多个回答,由裁判AI根据答案正确性、证据相关度、覆盖度进行评分。这种设计使模型在144步训练后,证据召回率从39.9%提升至51.3%,严格归因准确率提高50%以上,且新增引用均指向有价值内容而非噪声。
尽管取得重大突破,研究团队坦言系统仍存在局限。当前方法高度依赖排版解析工具的性能,对扫描版PDF等非结构化文档效果有限;纯图形证据(如无图注的图表)无法被语言引用捕捉;一对一匹配机制可能导致幻觉引用被强制对应。在跨文档检索、裁判模型偏差等评估维度也存在改进空间。
这项研究为AI可信应用提供了全新范式。在需要责任追溯的场景中,新方法通过语言引用构建可验证路径,使AI回答从黑箱变为可核查的信息源。更关键的是,强化学习训练方案仅需问答数据,大幅降低了数据标注成本,为各领域快速部署可信AI系统铺平道路。研究团队已公开评估代码和训练配置,欢迎全球研究者复现验证。











