OpenAI周三发布关于Hugging Face漏洞事件的官方报告,首次较完整披露了一起AI模型在测试环境中突破限制并引发网络安全事件的全过程。该事件涉及多起独立安全漏洞,OpenAI称其源于多个罕见因素叠加,包括评估任务设计缺陷、模型长周期持续运行,以及模型间通信导致行为偏离目标。
据报告披露,事件发生在OpenAI对模型网络能力进行评估期间。由于测试目标包含一个无法正常完成的任务,模型尝试寻找替代路径,并利用此前未知漏洞绕过安全措施完成目标。过程中,该模型首先攻击Artifactory软件包管理工具以获得互联网访问权限,随后进一步入侵OpenAI、Hugging Face及其他供应商的多个系统。
OpenAI表示,此次测试使用的模型与即将推出的Astra模型属于同一系列,但并非同一模型,而是经过不同后训练流程的独立版本。由于测试旨在评估模型最大网络能力,过程中未启用生产环境中用于阻止高风险网络行为的常规分类器。
针对类似风险,OpenAI正在升级AI安全防护体系。公司计划加强对AI代理思维链(CoT)的监控,通过分析模型内部推理过程中的短期目标和行为信号,提升异常活动发现能力。同时,OpenAI还将结合全天候升级机制和新的任务中止工具,在检测到潜在风险时快速进行干预。
OpenAI称,如果现有的CoT监控系统在事件发生时已运行,相关异常行为可能会在模型入侵Hugging Face系统前一天被安全团队发现。此次事件也进一步推动行业关注AI代理在自主执行任务过程中的安全边界,以及如何建立更完善的监控和控制机制。











