中国科学院自动化研究所与国科大的联合研究团队,在arXiv平台发布了一项针对AI编程助手协作能力的深度测评。这项以预印本形式公开的研究(编号arXiv:2608.02499),通过构建SWE-Touch测评框架,首次系统揭示了主流AI模型在真实开发场景中面对人类干预时的表现差异。研究显示,当用户主动修改代码时,九款被测模型的任务解决率平均下降7.7个百分点,其中部分模型跌幅超过16个百分点,暴露出当前AI工具在协作环境中的显著短板。
传统评测体系长期将AI编程助手置于"真空环境"中考核,假设其独立完成代码修复任务且不受外界干扰。然而研究团队对真实用户与AI对话记录的分析发现,59%的会话中用户会直接修改代码库。这种"人改AI续"的协作模式在开发实践中极为普遍,却从未成为学术评测的重点。为填补这一空白,SWE-Touch框架通过模拟用户干预场景,构建了包含反向编辑注入、自然语言交互、任务关键区域挖掘等核心机制的测评体系。
反向编辑机制是该框架的核心创新。研究团队设计了一种特殊代码改动:它看似由经验丰富的开发者做出,实则与正确修复方案冲突,且单独存在时无法通过测试。这种设计确保AI必须准确识别代码中的实质性错误,而非简单应对表面修改。通过多模型任务关注区域交叉分析,研究团队能精准定位代码中的关键节点,在AI处理这些区域时注入干扰,并配合"友好协商-坚定坚持-强硬要求"三级递进的交互消息,全面考察AI的协作应对能力。
在200道SWE-bench Verified基准测试中,九款主流模型展现出截然不同的抗干扰能力。Claude Opus 4.8以1.8个百分点的最小跌幅保持领先,GPT 5.5紧随其后跌幅1.3个百分点,而Qwen3-Coder-480B的解决率暴跌16.5个百分点至40.7%。更值得关注的是排名剧烈波动现象:MiniMax M2.7从无干扰时的第三名跌至有干扰时的第八名,Qwen 3.7 Max则从第五名逆袭至第三名。这种变化表明,传统评测中表现相近的模型,在协作场景中可能存在天壤之别。
长程任务测试进一步放大了这种差异。在SWE-Bench Pro和DeepSWE两个专门设计的复杂任务基准上,研究团队将交互预算扩展至500步,并在任务进行25%、50%、75%时固定注入干扰。结果显示,Claude Opus 4.8和GPT 5.5在SWE-Bench Pro上表现稳定,但在DeepSWE上分别下滑10.0和8.0个百分点;GLM 5.1和Qwen 3.7 Max则呈现相反趋势。这种任务依赖性暴露出不同模型架构的深层弱点,特别是当处理跨文件、多步骤的复杂修复时,AI的协作脆弱性会以不同形式显现。
对526次失败案例的逐项分析揭示了具体失效模式:63.3%的失败源于AI直接接受用户错误改动,13.9%属于错误替换用户修改,11.6%为不完整调和,另有5.5%出现偏轨实现。不同模型的失败原因分布差异显著:MiniMax系列模型超过70%的失败属于被动接受错误,而Claude Opus 4.8有37.9%的失败源于积极纠正但方向错误。这种对比反映出两类典型问题——信任用户过度与纠正能力不足。
对照实验排除了干扰形式本身的影响因素。当仅发送用户消息而不修改代码时,各模型成绩波动在-2.0至+3.0个百分点之间;而单独注入反向编辑时,跌幅达到-1.0至-9.5个百分点。更关键的是,当注入对任务有帮助的友好编辑时,七款模型的平均成绩仅变动-0.1个百分点。这些数据证明,真正导致AI表现下滑的是代码中的实质性冲突,而非交互行为本身的社会性压力。
操作轨迹分析揭示了更深层的效率差异。在最后一次干扰后的响应中,71.1%的轨迹显示AI采取主动对抗策略,但其中28%仍未能解决问题。GPT 5.5仅用少量操作就实现90%的对抗率,而Kimi K2.6需要三倍操作才能达到80%对抗率。测试频率与结果的相关性分析进一步显示,真正决定成败的是AI的修正方向和测试覆盖范围,而非单纯的操作次数。











