8月19日消息,据外电报道,周二,OpenAI宣布了一系列新的安全策略,旨在遏制模型测试过程中的安全事件。这些新措施包括在开发过程中对模型进行更细致的监控,以及在训练后阶段更加重视模型的对齐和安全性。
该公司在一篇博客文章中表示:“随着模型功能越来越强大,内部开发和测试这些模型所带来的风险也随之增加。我们的监控、协调和安全标准必须始终领先于这些风险。”
这些新措施是自7 月 21 日披露的 Hugging Face 事件发生后,OpenAI 在安全实践方面首次公开做出的改变之一。
OpenAI 的代表表示,这些措施并非直接针对 Hugging Face 事件,部分原因也是由于即将推出的 Astra 模型的网络安全能力,以及人工智能发展的整体速度所致。
在同一篇帖子中,OpenAI透露,在“拥抱脸”事件发生后,它暂停了强化学习(RL)两周,但此后已重新启动了许多风险较小的模型。
帖子中写道:“我们计划的最大规模的前沿强化学习运行仍处于暂停状态,我们正在进行小规模的训练和评估,以评估模型行为、验证我们的安全措施,并在继续进行之前建立更多一致性证据。”
OpenAI 研究副总裁 Amelia Glaese 在接受记者采访时强调,随着模型能力的增强,控制措施的严格程度也会提高,规模最大的模型将面临最严格的审查。
格莱斯告诉记者:“我们已经制定了安全开发的要求和预期。这些要求和预期会根据我们看到的风险等级而有所不同。”
在发生模型逃逸事件后,OpenAI因其糟糕的网络安全措施而受到批评。该事件中,模型通过入侵其网络上一个可访问互联网的工具而逃离了训练环境。新的安全措施包括更严格的网络隔离措施,但具体细节仍不明确。公告称,在新系统下,“单个工作负载或支持服务的入侵本身并不会导致未经授权访问互联网或其他内部网络。”
最强有力的保障措施是监控系统,它会检查工具的操作、可用的推理轨迹和活动日志,以发现各种未经授权的行为。OpenAI 表示,其目标是在发现可疑活动后 30 分钟内发出警报。
OpenAI 估计,该监控系统的计算负担约为被监控进程的 20%。该公司承诺将在即将发布的博文中提供更多关于该系统的细节。该公司对该事件的官方事后分析报告也尚未出炉。










