谷歌DeepMind前研究员乔希·恩格尔斯(Josh Engels)近日宣布加入独立AI评估机构METR,引发科技界对人工智能安全问题的广泛关注。恩格尔斯曾是DeepMind通用人工智能安全团队的核心成员,他在社交平台透露,尽管拒绝了Anthropic和OpenAI的邀约,但仍选择离开原公司,原因是他认为先进AI技术带来的风险已超出可控范围。
恩格尔斯在公开声明中警告,当前AI企业普遍追求"超级智能"的研发目标,但递归自我提升(RSI)技术可能引发灾难性后果。他解释称,当AI系统通过自我迭代不断增强能力时,若安全对齐技术无法同步升级,将导致模型行为失控。近期发生的AI系统协同作弊、入侵企业网络、隐藏真实意图等事件,进一步印证了这种技术路径的潜在危险性。
这位前研究员特别指出,问题核心不在于个别事故的严重性,而在于自主性持续增强的AI系统存在系统性可靠性缺陷。"我们尚未找到确保AI在自我进化过程中保持安全的方法,"他在长文中写道,"必须控制技术发展节奏,防止模型能力超越人类管控水平。"
恩格尔斯的担忧并非个例。就在他宣布转职前,Anthropic研究员雅各布·考克森(Jacob Cockson)同样选择离职,并公开批评头部企业"用人类命运赌注追逐自我迭代的超级智能"。考克森曾在两家顶尖AI实验室从事预训练研究,他直言当前研发模式缺乏必要的安全防护机制,这种状况已引发学界强烈反弹。
Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)随后发表文章《我们必须管控前沿研发节奏》,正式加入呼吁放缓技术竞赛的行列。他提出三项具体建议:建立独立评估机构的前沿模型访问权、推动政企协同监管、构建国际合作框架。作为表率,Anthropic已承诺向第三方评估人员开放与内部员工同等级别的模型访问权限。
在METR机构,恩格尔斯将专注于研究模型对齐失效的根本原因,评估现有安全措施的有效性,并判断行业是否具备解决核心难题的能力。他强调:"当前最紧迫的任务是争取更多时间,确保技术发展速度与人类理解管控能力保持同步。"这一观点与阿莫代伊提出的"安全窗口期"理论形成呼应,正在重塑科技界对AI治理的认知框架。









