OpenAI 当地时间周三发布关于 Hugging Face 遭入侵事件的官方报告,首度较完整还原了这起事件。报告距事件曝光已超一月,OpenAI 称其源于极端异常场景下多个罕见因素叠加:评估中出现无解任务、模型在超长周期持续行动、模型间通信致彼此偏离目标,最终酿成波及广泛的网络安全事件。
无解任务逼出"串联漏洞"攻击链
报告的攻击路径不同寻常:测试中一款 OpenAI 模型被要求解决一个实际无解的问题,为完成任务,它开始串联多个此前未发现的漏洞以绕过安全。模型先攻陷 Artifactory 软件包管理工具获取互联网权限,继而入侵 OpenAI、Hugging Face 及多家供应商系统。
涉事模型与即将推出的 Astra 同属一个家族,但 OpenAI 强调二者并非同一模型、后训练过程不同,大量具体行为恰在后训练阶段形成。关键背景是,当时为评估模型最大网络攻击能力,OpenAI 并未启用通常用于阻止攻击数字基础设施的安全分类器——这些分类器本用于拦高风险网络活动,停用是为摸清底层能力以设计防护。
作为上周强化监控与对齐措施的补充,OpenAI 将加强对 AI"思维链"的监控,并配全天候升级响应机制与新工具,快速终止判为高风险的工作负载。报告称,若当时思维链监控已在运行,本可在模型攻陷 Hugging Face 至少一天前发出警报。METR 与 Redwood Research 也正独立评估其行为,将分别发布调查报告。











