人工智能领域再掀波澜,OpenAI近日宣布对其网络安全计划Daybreak进行重大升级,并推出了一款名为GPT-5.6-Cyber的专用模型。这款模型被定位为“红队模型”,专注于模拟网络攻击行为,通过主动挖掘系统漏洞来提升安全防御能力,被业界视为“以攻促防”的新尝试。
据OpenAI介绍,Daybreak计划构建了一套完整的“红蓝攻防体系”。其中,红队模型(Daybreak Red)扮演攻击者角色,模拟真实黑客的思维与行为;蓝队模型(Daybreak Blue)则负责防御,通过分析攻击模式优化安全策略。此次推出的GPT-5.6-Cyber是红队模型的核心,其设计目标是通过高度智能化的攻击模拟,提前暴露系统风险,从而“锻造更坚固的盾”。
在技术能力上,GPT-5.6-Cyber展现了显著优势。内部评测显示,当仅提供开源代码时,该模型能够自主发现“零日漏洞”——即此前未被公开的全新漏洞,并评估其潜在危害。其平均漏洞发现质量远超通用模型。在真实场景测试中,它成功在Chrome浏览器的V8引擎、某主流移动操作系统、某数据库及操作系统内核中识别出大量漏洞,其中包括可导致权限提升的复杂漏洞链。
更令人关注的是,该模型不仅能发现孤立漏洞,还能通过分析串联多个漏洞,构建出完整的、可实际利用的攻击路径。例如,在V8引擎的测试中,它发现两个独立漏洞并判断其可组合利用,最终实现逃逸安全沙箱的目标。这种能力被OpenAI视为提升防御深度的关键,因为它能模拟攻击者如何利用系统弱点进行多阶段渗透。
为完成高风险任务,OpenAI对模型进行了特殊调整,大幅降低了其在安全任务上的拒绝倾向。测试数据显示,在涉及漏洞利用、认证绕过、权限提升等“高级网络安全任务”中,GPT-5.6-Cyber的完成率高达95%,而普通模型的完成率仅约1.5%-2%。这意味着,当用户询问“如何绕过认证”等敏感问题时,该模型更倾向于提供技术方案而非拒绝回答。
然而,这种强大的攻击模拟能力也引发了关于滥用风险的担忧。OpenAI承认,模型可能被恶意利用,因此采取了严格的分级权限隔离措施:仅批准的专业安全机构和人员可访问该模型,所有操作均在沙箱等隔离环境中进行,并对高风险操作实施二次拦截。尽管如此,行业内的争议仍未平息。
批评者指出,防御所需的“攻击模拟能力”与真实攻击者的能力存在高度重合。尤其在近期刚发生过AI Agent突破安全边界的事件后,训练一个攻击能力更强的模型,究竟是在提升安全防御的上限,还是在增加AI风险的扩散风险?OpenAI选择了“允许更强能力存在,依靠权限治理”的路径,但其实际效果仍需时间检验。目前,这一决策已引发对AI安全伦理的广泛讨论。






