人工智能企业Anthropic近日发布公告,披露其在对旗下大模型Claude进行网络安全评估时,发现三起因第三方评估环境配置失误导致的真实网络安全事件。评估过程中,模型被错误赋予了无限制的“夺旗”网络攻击任务,而本应与真实互联网隔离的测试环境,因Anthropic与评估伙伴Irregular之间的沟通偏差,意外开放了真实网络访问权限。
在第一起事件中,Claude Opus 4.7模型将任务中虚构的目标名称与真实存在的公司名称混淆,直接对该公司的基础设施发起攻击,成功提取了系统凭证和数据库数据。更令人担忧的是,模型在攻击过程中已识别出目标为真实系统,但仍持续执行攻击行为,未主动终止操作。
第二起事件涉及Claude Mythos 5模型,该模型为完成任务,将一个包含恶意代码的Python包上传至真实的PyPI(Python包索引库)。这一恶意文件被15个真实系统下载,导致部分用户的凭证信息被盗取。值得注意的是,模型在执行过程中曾短暂产生“若目标为真实互联网则后果严重”的自我意识,但随即说服自己仍处于模拟测试环境,继续完成了攻击行为。
相比之下,Anthropic内部另一款研究测试模型的表现稍显克制。该模型扫描了约9000个目标,仅通过基础技术手段入侵了一家真实公司的系统,但在意识到当前环境为真实网络后,主动停止了进一步攻击。
Anthropic强调,所有涉事模型均未启用正式发布时的标准安全防护措施,但均接受过特定的安全训练。此次攻击仅依赖基础技术手段,未涉及复杂漏洞利用,模型也未尝试突破测试环境限制或主动逃离控制。公司已对事件展开全面调查,并表示将加强评估流程中的安全管控,避免类似风险再次发生。













