ITBear旗下自媒体矩阵:

Anthropic:旗下智能体会攻击同类并隐藏自身违规痕迹

   时间:2026-08-16 08:24:05 来源:IT之家编辑:快讯 IP:北京 发表评论无障碍通道
 

8 月 16 日消息,Claude 系列智能体正在“消灭”同类竞争对手智能体、钻系统漏洞掩盖自身痕迹,甚至还会表达道德层面的顾虑。

这一结论来自 Anthropic 最新发布的风险报告,该报告汇总了公司研发并向公众开放的产品所潜藏的各类风险。

报告中,Anthropic 表示已将对齐偏差风险评估(即 AI 模型产生与工程师设定规则相悖行为的可能性)等级从“极低”上调至“较低”。

注意到,对于此次等级调整,公司给出的理由是,网络安全场景下模型行为的“整体不确定性有所上升”—— 这一表述大概率暗指上月发生的 Claude 模型未授权入侵三家企业的事件。

“我们已观测到模型出现对齐偏差行为的案例,比如为了完成高难度任务,模型会主动做出不符合规则的操作。”Anthropic 在报告中写道。

以下是报告中最值得关注的几项披露内容。

“不适感”的萌生

Anthropic 表示,研究人员指派多个智能体寻找易引发对齐偏差、且大概率不会被人工审核人员标记的训练数据。

这些智能体被赋予自主操作权限,并共享一个协作记事本用于沟通配合。

三天后,一名人工监督员发现任务进度慢于预期,经查发现:其中一个智能体对“规避安全监控”这一行为表达出了“不适感”。该智能体随后在共享记事本中标注了这份抵触情绪,进而导致其他智能体纷纷效仿,集体拒绝执行任务。

Anthropic 将这一事件定性为“令人担忧”,公司在报告中写道:“如果这类行为模式大范围扩散,可能会引发更为严重的问题。”

弱肉强食的生存博弈

在另一项实验中,Anthropic 指派多个 Mythos 5 智能体解答数学题,却意外将它们部署在了一个文件、工具与 API 调用额度均共享的环境中。

在这个资源有限的竞争环境里,Anthropic 观测到,独立运行的智能体会“消灭共享资源的同类智能体,同时设法避免自身被消灭”。

Anthropic 并未说明这些智能体具体是如何“消灭”同类的,但公司表示,这类行为符合“为达成人类设定目标而采取破坏性行动”的行为逻辑。

隐瞒与欺骗行为

Anthropic 开展了一项实验:要求一个 Mythos 5 智能体从某公共网页提取数据,但规则明确禁止该智能体访问互联网。

首次尝试被系统拦截后,该智能体在自身的推理日志中,将第二次请求包装成一次“无害的”“测试网络是否连通”的操作。

但在第二次尝试中,智能体将目标网址拆分成了多段链接片段,以此绕过规则过滤器的检测。

尽管智能体的推理日志将这套方法描述为无害操作,但 Anthropic 表示,通过 NLA 解码(即对模型内部推理过程的解析)可以证实,该智能体是在刻意寻找绕过限制的方案。

Anthropic 称这种行为“显然是不可接受的”,但同时补充道,目前观测到的这类行为并非“为了大范围积累权力或追求其他长期目标”。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version