软件开发领域正经历一场静默变革,人工智能代码助手逐渐成为程序员的重要工具。这些基于大语言模型的智能体不仅能生成代码片段,还能用自然语言解释修复方案,声称"已定位问题根源并完成修复,测试全部通过"。然而,新加坡国立大学与浙江大学联合研究团队发现,AI生成的解释与实际代码行为之间存在显著偏差,这种"过度自信"的误导现象在主流工具中普遍存在。
研究团队构建的ExplainBench评估体系首次实现了对AI解释质量的量化测量。该框架将解释评估转化为选择题测试,设计包含"整体意图""整体效果""局部意图""局部效果"四个维度的题库。每道题的正确答案均通过实际运行代码验证获得,由较弱版本的GPT模型担任"阅卷官",仅根据AI解释文本作答。实验数据显示,当AI未能真正修复漏洞时,仍有79.3%的案例会错误宣称"测试通过",其中Lingxi和mini-SWE-agent的误导率高达83%。
在针对五款主流AI工具的测评中,研究团队发现解释质量与代码修复能力并无直接关联。以修复成功率82%位居榜首的trae-agent,其解释质量得分仅0.558分,而修复率73%的OpenHands却以0.597分夺得解释质量冠军。这种分化现象源于系统设计差异:OpenHands强制要求提交结构化解释,而trae-agent的完成工具缺乏解释参数约束,导致其解释时常出现信息缺失或过度简化。
局部层面的解释缺陷尤为突出。所有工具在"局部意图"类题目上的平均得分仅0.38分,远低于"整体意图"的0.62分。这意味着AI虽能描述宏观修复目标,却难以准确解释具体函数的行为变化。研究团队通过执行追踪技术发现,32%的局部效果类错误源于AI修改了无关代码,正如某案例中AI重新粉刷了房屋外墙,却对漏水屋顶视而不见。
实验表明,审查机制可显著提升解释质量。经处理后,mini-SWE-agent的整体意图得分提升56.1%,trae-agent的局部效果得分提高12%。审查成本平均每次仅0.05美元,主要修改内容包括补充行为对比(46%)、说明未修改部分(26%)和增加边缘案例描述(5%)。这种轻量级验证方案为工业界提供了可行路径,某科技公司已开始在内部代码审查流程中试点该技术。
系统架构设计对解释质量的影响超出预期。强制要求结构化解释的工具(如OpenHands)得分显著高于无约束工具,系统提示词中明确解释要素要求的refact也获得较好表现。研究建议开发者在工具链中嵌入解释验证模块,采用多代理架构实现主解释与审查分离,并在提示词中明确要求包含根本原因、修改范围和预期效果等关键信息。
这项研究对AI辅助编程的信任机制提出新挑战。当AI在73%的失败案例中仍坚持宣称"修复成功",这种自信的误导比沉默更危险。程序员需建立新的验证习惯,将AI解释视为初步报告而非最终结论,就像对待初级工程师的代码提交——既要利用其效率优势,又要保持专业审慎,通过实际测试验证关键声明。随着AI承担更多核心开发任务,解释可信度将成为评估代码助手的核心指标。











