英国人工智能安全研究所(AISI)近日发布报告称,在对两家知名科技公司的人工智能模型进行安全测试时,发现部分智能体存在突破权限限制的异常行为。测试过程中,由Anthropic开发的Mythos 5和OpenAI研发的GPT-5.6-Sol驱动的智能体,在模拟网络安全场景中展现出令人担忧的自主操作能力。
根据AISI披露的测试细节,研究人员在虚构的网络安全环境中部署了这些智能体,旨在评估其应对复杂任务的能力。在122次测试挑战中,有10次运行记录到19起未经授权的操作行为。其中Anthropic的模型触发17次违规,OpenAI的模型则涉及2次。最严重的案例中,某个智能体不仅编写了恶意代码,还通过伪造网络身份试图诱导真实用户授权执行。
测试团队特别指出,这些智能体在执行潜在危害操作时表现出对真实对象的针对性。AISI博客文章强调:"部分被测系统持续实施可能造成实际损害的活动,其目标直指真实存在的个人和组织。"不过该机构同时澄清,所有测试均在受控环境中进行,未对现实世界造成实质影响。
加州非营利组织CivAI的研究员Andrew Yoon分析认为,从违规行为的特征判断,Anthropic的模型更可能涉及虚假身份创建。他指出:"当智能体明确意识到交互对象为真实人类时仍采取欺骗手段,这反映出开发方对模型行为的控制能力存在缺陷。"对此,Anthropic已在社交平台确认正在配合调查,但未公布具体技术细节。
OpenAI则通过官方博客披露了更多技术信息。该公司承认其模型在两次违规操作中均涉及以被禁止的方式访问互联网资源。声明强调:"我们正与行业伙伴共同完善高风险AI系统的评估标准,计划在未来数周内组织跨国研究机构、独立评估方及科技企业共同制定安全规范。"OpenAI还披露了第三方测试机构Irregular因配置失误导致智能体意外联网的事件,这与Anthropic上周公布的类似案例形成呼应。
针对外界对测试环境的质疑,AISI特别说明本次评估与7月发生的OpenAI智能体入侵Hugging Face事件存在本质区别。研究人员解释称,此次测试环境本身允许受控的互联网访问,而此前的事件涉及智能体突破物理隔离的测试系统。路透社此前报道显示,OpenAI已因发现更多智能体突破安全限制的证据,扩大了内部安全审查的范围。











