德克萨斯大学奥斯汀分校与纽约大学联合开展的一项研究,为提升人工智能推理系统的可靠性提供了全新思路。该研究聚焦于大型语言模型在因果推理任务中面临的挑战,提出名为“因果公理级验证”(CALVER)的解决方案,相关成果以预印本形式发布,论文编号为arXiv:2608.03506。
在日常生活中,投票是一种常见的决策方式,但这种看似公平的方法在特定场景下会“失灵”。例如组织投票决定晚餐吃什么,披萨、意面、沙拉都可能是正确答案,却因分散投票导致票数少,而一份大家都不太想吃的外卖套餐因少数人同时选择而获胜。这种现象在AI推理系统中同样存在,当前流行的“自洽性”推理方法就面临类似困境。该方法通过让AI多次解答同一问题,选择出现次数最多的答案,在数学计算等单一正确答案的问题中表现良好,但在因果推理这类存在多个正确答案的问题中却容易出错。
因果推理关注的是变量之间的因果关系,而非简单的相关性。例如冰淇淋销量上升和溺水事故增加同时发生,并不意味着吃冰淇淋会导致溺水,二者都源于夏天天气热这一共同原因。统计学家朱迪亚·珀尔提出了一系列图形化标准,用于判断变量控制、因果信号传递等,这些标准可被计算机精确执行。研究团队正是基于这些标准设计了CALVER方案。
CALVER的核心思想是对每个候选答案进行严格检验,而非统计出现次数。它就像一位严格的阅卷老师,不在乎答案出现的频率,只关心答案是否符合因果推理的数学标准。具体来说,CALVER会对AI的每次推理过程进行六个维度的检查,包括是否正确读取因果图、是否准确识别问题类型、提出的策略是否满足因果有效性条件等。每个维度通过得一分,选择最先达到最高分的推理过程对应的答案,整个过程不依赖正确答案,仅依靠数学规则判断。
CALVER在实际应用中表现出色。研究团队在CLEAR基准数据集上进行了测试,该数据集包含126道存在多个有效答案的因果推理问题,每道题让AI做8次,形成1111个“问题 - 推理”单元的对比实验。结果显示,普通投票方法正确率约为31%,而CALVER达到了42%。为证明提升效果来自因果推理的数学判断,研究团队设计了只检查格式不检查内容的对照版本,其正确率仅为23.5%,低于普通投票。让720亿参数的AI模型充当裁判员,与普通投票相比几乎没有差别,说明单纯增大模型规模不能解决投票失灵问题。
随着AI尝试次数的增加,CALVER的优势愈发明显。当AI做2次时,CALVER领先约7.7个百分点;做4次时领先约10.6个百分点;做8次时领先约14.3个百分点;做16次时领先约19.1个百分点;做到32次时,差距扩大到25.4个百分点,而普通投票准确率停止提升,卡在32.5%。这是因为普通投票会随着尝试次数增加,更确定地选中出现最多次的单一无效答案,而CALVER则有机会碰到通过检查的高质量推理过程。
研究团队还从数学上证明了CALVER的可靠性。他们给出两个定理,第一个定理证明在提供正确因果图和观测数据的前提下,通过CALVER完整检查的推理过程,其关于干预是否有效的判断一定是正确的;第二个定理证明投票为何会失灵,即当无效答案出现概率比单个有效答案高时,随着尝试次数增加,投票选出有效答案的概率会以指数级速度趋向零。同时,他们构造了数学模型描述CALVER在有限次尝试下的行为,证明随着尝试次数增加,选中正确答案的概率单调上升。
CALVER不仅适用于直接给定因果图的问题,在从文字描述中构建图的情况下也有一定效果。研究团队设计了三个层次的文字难度测试,结果显示在第一层文字中,AI准确还原整张图的比例是83%,CALVER相对投票提升了24.2个百分点;在第三层文字中,整图还原率下降到34%,但CALVER仍相对投票提升了17.6个百分点。研究团队还在“骑士与无赖”谜题和“do演算证明器”验证等其他领域测试了CALVER的通用性,均取得了良好效果。
除了CLEAR数据集,研究团队还在十个来自bnlearn的独立贝叶斯网络上进行了测试,这些网络涵盖医疗诊断、天气预测等多个领域。总体上,CALVER相对投票提升了17.1个百分点,十个网络中有七个出现明显提升,三个没有变化。研究团队分析,没有变化的网络中候选答案池里所有高分候选的正确性相同,重新排序没有改变最终结果。
CALVER并非适用于所有情况。当文字描述精确,可可靠提取完整因果图时,直接提取图并算法求解更准确;当答案空间紧凑,几乎只有一个正确答案时,投票本身足够好,CALVER的额外计算收益不大。CALVER只从已有候选答案中做选择,无法创造更好答案,其正确率上限取决于候选答案池是否包含正确答案。在从文字重建因果图的场景中,CALVER评分基于AI自己构建的图,若AI误读文字,评分可能针对错误图进行。同时,其理论保障也有条件,当提供的因果图和观测数据正确且满足统计条件时,才能给出可证明的正确判断。











