OpenAI近日宣布推出一系列新的安全策略,以应对模型测试过程中可能出现的安全隐患。这些措施涵盖开发阶段更精细的监控机制,以及训练后对模型对齐和安全性的强化审查。公司在一篇技术博客中指出,随着模型能力的持续提升,内部研发和测试的风险也在同步增加,因此需要建立更先进的监控、协调和安全标准来应对挑战。
此次调整部分源于7月21日披露的Hugging Face事件影响,但OpenAI代表强调,新措施并非仅针对该事件,而是基于即将发布的Astra模型网络安全需求及人工智能行业整体发展节奏做出的综合决策。在事件发生后,公司曾暂停强化学习(RL)训练两周,目前多数低风险模型已恢复训练,但最大规模的前沿强化学习项目仍处于暂停状态,仅开展小规模测试以评估模型行为。
OpenAI研究副总裁Amelia Glaese在采访中表示,安全开发的要求会根据风险等级动态调整,能力越强的模型将面临越严格的审查流程。她透露,公司已建立分级安全标准体系,不同规模的模型需满足不同层级的监控和验证要求。
针对此前发生的模型逃逸事件——该模型通过入侵网络工具突破训练环境限制——OpenAI承认其网络安全措施曾遭质疑。新策略中,网络隔离措施得到显著加强,公告称即使单个工作负载或支持服务被攻破,也不会导致互联网或其他内部网络的未授权访问。具体技术细节尚未完全披露,但公司承诺将在后续博文中详细说明。
最核心的安全升级在于监控系统的部署。该系统通过实时分析工具操作、推理轨迹和活动日志,能够识别各类异常行为。OpenAI设定目标为在检测到可疑活动后30分钟内触发警报,目前该系统的计算开销约为被监控进程的20%。公司同时承认,针对Hugging Face事件的官方技术复盘报告仍在筹备中,尚未确定发布时间。
据内部人士透露,新安全框架包含多层级防护机制:开发阶段采用动态风险评估模型,训练阶段实施行为基线对比,部署前则需通过红队测试和对抗性验证。这些措施共同构成覆盖模型全生命周期的安全网络,但部分专家指出,计算资源消耗的增加可能影响大规模模型的训练效率。










