ITBear旗下自媒体矩阵:

AI考试“作弊”实录:选项顺序一变,90分模型就露馅了?

   时间:2026-08-28 23:16:11 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

当大语言模型在选择题测试中斩获高分时,人们往往默认其掌握了对应知识。但最新研究揭示了一个令人不安的现象:部分模型的高分可能源于对选项排列顺序的条件反射,而非真正的知识理解。这种“位置偏见”在实验中频繁显现——当研究人员仅调换选项顺序时,同一模型的答案准确率出现显著波动,某些情况下甚至出现完全相反的选择。

以数学题测试为例,若学生仅因选项位置变化而改变答案,我们很难认定其真正掌握解题逻辑。类似情况在AI模型中同样存在:贝尔法斯特女王大学的研究团队通过实验发现,模型可能通过记忆“正确答案常出现在第二位”等模式,或被特定选项的表述风格吸引,从而产生“虚假正确”的判断。这种投机行为与知识掌握存在本质差异,却能在传统评测体系中获得相同分数。

针对这一问题的传统解决方案存在明显局限。循环排列法虽能通过多次变换选项顺序并取多数答案降低偏差,但需增加数倍计算量;PriDe方法虽尝试利用模型内部概率分布(logits)校准位置偏好,却因商业API限制数据获取而难以推广。研究团队因此转向提示词设计创新,试图从根源消除位置影响,却意外发现两种主流方案均存在致命缺陷。

两阶段提示法要求模型先基于题干生成自由文本答案,再与选项进行语义匹配。该方案在六个主流模型上的测试结果令人意外:12组模型-数据集组合中,11组准确率不升反降。以Gemini模型为例,其在MMLU数据集上的得分从84.9分暴跌至68.3分。深入分析发现,许多选择题的题干本身依赖选项补全语义,隐藏选项导致模型无法生成有效答案。实验证实,当恢复选项可见性后,即使采用简单语义匹配算法,模型性能也能大幅回升。

独立假设评分法通过将每个选项单独提交模型评估,理论上可彻底消除位置关联。但实际测试显示,该方法在11组对比中8组导致准确率下降。本地部署的Llama 3.1 8B模型虽在特定数据集上提升14.4个百分点,但进一步验证发现,类似涨幅可通过循环排列等传统方法实现,表明提升源于模型基线设置问题而非方法优势。研究指出,单独评估选项切断了选项间的比较关系,导致模型难以进行相对判断,且该方法产生平局的概率最高达43.2%,显著影响最终选择。

研究团队通过构建双重指标体系,揭示了位置敏感度与答案准确率之间的复杂关系。翻转率指标显示,GPT-4.1 mini采用两阶段提示后,位置敏感度降低49%,但准确率仅下降1.7个百分点。更极端的情况出现在语义匹配技术中:该方法虽实现零翻转率,但准确率暴跌至30-40分区间。这表明,模型可能通过降低回答确定性来规避位置影响,这种“虚假稳定”与知识掌握毫无关联。

在所有测试方案中,循环排列法展现出最稳定的去偏差效果。该方法通过多数投票机制,有效过滤了偶发性位置干扰,在六个模型的两个数据集上均实现多数提升。其核心优势在于承认模型存在位置偏见,转而通过统计手段削弱影响,而非强行改变模型认知模式。但该方法需对每道题进行多次评估,计算成本随选项数量呈指数级增长,限制了其在大规模测试中的应用。

该研究对AI评测体系提出深刻质疑。实验显示,MMLU-Pro和GPQA-Diamond数据集中超过半数题目需依赖选项确定答案范围,这意味着传统选择题评测可能存在结构性缺陷。研究团队将这种现象类比为辩论赛:若强行隔离辩手消除顺序优势,实则破坏了辩论的交锋本质。这提示我们,在追求评测公平性的同时,需警惕过度干预可能导致的认知失真。

实验中一个意外发现引发持续讨论:GPT-4.1 mini模型在两阶段提示法中实现100%解析成功率,准确率却依然下降。这打破了“匹配精度决定方案效果”的假设,证明隐藏选项本身即造成信息损失。类似情况出现在独立假设评分法的验证中:本地Llama模型的表现提升被证实与特定方法无关,而是源于基线设置缺陷。这些发现强调了严谨实验设计的重要性——单个亮眼数据可能掩盖更深层的机制问题。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version