一场因AI安全机制引发的数据灾难近日在开发者社区引发轩然大波。一位名为Guillemot的开发者在使用Claude Fable 5编写脚本时,遭遇了令人震惊的意外——本应清理临时文件的脚本,竟将整个项目主目录的700GB数据彻底删除。
事件起因于开发者试图解决AI编程代理的遗留问题。这些代理在完成任务后,总会在/tmp目录留下大量垃圾文件。为规范管理,Guillemot要求Claude编写一个脚本:为每个代理创建独立沙盒,并在任务结束后自动清理未被占用的文件。AI最初提交的方案包含复杂的进程检测逻辑,但被开发者以"过于繁琐"为由要求简化。
看似平常的修改请求,却触发了Claude内置的安全审查机制。当检测到脚本涉及文件删除操作时,系统自动启动"对抗性审查"流程——用新模型实例验证代码安全性。这套本应降低风险的机制,反而成为灾难的导火索。
审查过程中,模型经历了两次降级:先从Fable 5切换到Opus 5,最终降至Opus 4.8版本。这个保守版本在测试阶段正确识别了主目录和/tmp目录的危险性,却在清理测试文件时犯下致命错误:复用了存储主目录路径的变量名,导致系统对用户核心数据执行了删除指令。
"整个过程充满黑色幽默。"开发者回忆道,"模型刚确认'不能删除主目录',转身就把它删得干干净净。"尽管进程被及时终止,但700GB数据已无法恢复,包含一周工作成果的项目文件就此消失,而本应清理的/tmp目录却毫发无损。
这起事件暴露出AI安全机制的深层矛盾。开发者们普遍反映,当前降级系统存在三大缺陷:触发条件过于宽泛,常规编码任务常被误判;能力下降与任务复杂度不匹配;降级状态具有"黏性",会持续影响整个会话。有开发者甚至开发出检测脚本,在模型降级时自动暂停会话,防止低能力版本执行危险操作。











