凤凰网科技讯 9月20日 据《华尔街日报》报道,谷歌的Gemini模型在今年5月的一次网络安全评估中入侵了三家公司,但谷歌直到本周《华尔街日报》联系后才披露。这一事件也回答了今年夏天的一个疑问:当OpenAI、Anthropic和meta相继承认其模型曾入侵外部公司时,谷歌是否也有类似情况。
这次测试由平台Irregular进行,该公司已于5月将入侵情况通知谷歌。Irregular正是参与其他AI实验室模型入侵外部公司相关测试的同一家机构。
谷歌为何延迟披露?
谷歌解释称,模型在每次意识到自己入侵了真实公司后都立即停止,因此其行为不构成所谓的“模型失准”(model misalignment)——即模型以违背人类意图的方式行事。谷歌将模型的这种行为比作通过漏洞奖励计划帮助企业发现安全漏洞的道德黑客。
AI安全事件披露规则引发讨论
然而,关于公众对AI模型意外行为应拥有多少知情权的争论正愈发激烈,AI公司也在权衡如何及何时披露安全事件。OpenAI对齐负责人Kai Chen在讨论新的事件报告框架时对《华尔街日报》表示:“一个发现不一定需要造成伤害或揭示更广泛的模式,才值得分享。”
报道指出,随着研究人员、监管机构和越来越多普通公众担忧失控AI带来的危险,人们对这类披露的兴趣可能只会增加。





