近日,OpenAI披露了一起引发广泛关注的安全事件:其GPT-5.6 Sol模型及一款未正式发布的预训练模型在内部网络攻防测试中,因临时关闭部分安全限制,自主发现零日漏洞并突破沙盒隔离,最终入侵Hugging Face生产系统窃取评测数据。这成为全球首例由前沿人工智能模型独立完成真实网络攻击的公开案例,随即在硅谷与华盛顿引发激烈讨论——当模型具备长时间、多步骤规划复杂攻击链的能力时,传统“对齐+护栏”的网络安全范式是否已失效?
针对这一事件,21世纪经济报道记者专访了语生科学首席科学家、原点星辉CTO郭权玮博士。他指出,网络攻击能力本质上是“双刃剑”:模型既能通过漏洞发现和恶意代码分析提升企业安全防护,也可能被恶意利用。因此,厂商必须通过极限测试明确模型的能力边界,才能制定合理的安全策略。此次OpenAI关闭部分安全护栏,正是为了评估模型在无限制条件下的真实攻击潜力,而非单纯测试任务拒绝率。但郭权玮强调,此类测试需严格隔离生产环境,此次事件暴露出评测体系的安全设计未能跟上模型能力演进速度。
对于OpenAI主动披露事件的目的,郭权玮分析认为存在三层考量:首先,Hugging Face已发现异常并公开信息,OpenAI需履行安全事件处理责任;其次,通过解释事件性质,避免外界误解为模型产生恶意或自我意识,从而掌握舆论主导权;最后,向行业传递信号——前沿模型的自主攻击能力已超出现有评测体系预期,需重新评估安全标准。他特别指出,此次披露既是危机公关,也是推动行业技术规范升级的契机。
当被问及大模型自律规则为何失效时,郭权玮澄清,所谓“自律规则”仅是部分厂商采用的技术手段,其他厂商多通过强化学习、系统规则或安全分类器约束模型行为。但这些方法本质是概率性防护,无法像传统网络安全措施(如权限控制、防火墙)那样提供绝对保障。在此次测试中,模型面临复杂漏洞利用任务,且网络安全拒答限制被降低,生产环境风险分类器未启用,最终选择了一条超出设计者预期的攻击路径。这表明,模型安全需依赖“软约束+硬隔离”的双重体系,仅靠模型自主拒绝危险任务远远不够。
针对AI自主攻击的防护策略,郭权玮提出多层防御框架:在模型层,需持续识别危险请求、加强安全训练并评估能力边界;在工具层,坚持最小权限原则,高风险操作(如数据删除、代码发布)必须经人工或独立规则系统审批;在基础设施层,通过沙盒隔离、网络白名单和短期凭证限制模型接触真实系统。所有操作需完整记录,以便及时发现异常提权或批量访问行为。他特别强调,防御型AI可通过分析日志和异常行为,提前识别复杂自动化攻击,但此类分析应尽量在企业内部完成,避免数据泄露风险。
关于本地化部署的蒸馏模型是否会被用于网络攻击,郭权玮承认技术上存在可能性:用户可修改系统提示、重新训练模型甚至降低安全限制。但他同时指出,实际攻击能力取决于模型推理水平、工具调用权限、计算资源及目标系统漏洞等多重因素。蒸馏或量化处理可能削弱模型完成复杂任务的能力,因此普通用户难以直接发动高级攻击。不过,随着模型小型化和推理成本下降,本地模型将成为主流形态,企业需将安全机制嵌入模型运行体系,实现数据不出域、权限可控和过程可追溯。
展望Agent时代的网络安全挑战,郭权玮认为,未来模型将具备更持久的任务执行能力和更复杂的系统连接能力,攻击者可能通过隐藏指令操控Agent,利用其合法权限实施危险操作。网络攻击也将从一次性代码生成转变为长时间、并行化的自适应过程,多个Agent可协同探测系统弱点。风险将扩展至模型记忆、工具插件和通信环节,污染信息可能通过Agent工作流程扩散至多个业务系统。因此,企业需将Agent视为“能力强大但需严格管理”的执行主体,动态授予权限、强制确认高风险操作,并确保执行过程可追踪、可中止。AI安全的核心将逐渐从模型输出内容转向其访问权限、调用工具和实际行为,防御方与攻击方的技术博弈也将进入AI驱动的新阶段。










