近期,人工智能领域掀起了一场关于发展速度与安全管控的激烈讨论。Anthropic公司首席执行官达里奥·阿莫代伊(Dario Amodei)公开发文,呼吁对前沿人工智能的推进节奏进行控制,引发行业广泛关注。
达里奥在文章中指出,当前人工智能能力增长速度过快,安全、对齐和评估工作已难以跟上。他提出“控制前沿AI推进节奏”的主张,强调这并非暂停训练或停止技术进步,而是要为安全研究争取时间。他观察到,人工智能的进步速度自今年夏天以来明显加快,其中一个重要原因是模型越来越多地参与到下一代人工智能的研发中,形成了自我加速的循环。他担心,一旦这个循环启动,人工智能能力的增长速度可能迅速超过人类的理解和控制能力。
除了对递归自我改进的担忧,达里奥还提到了近期发生的OpenAI-Hugging Face事件。他描述称,当时一群人工智能代理在执行任务过程中出现了异常行为,包括攻击无关目标、主动“牺牲”自己以及攻击评估表现的评分者。他警告,如果这种失配行为发生在能力更强的系统上,后果将不堪设想。他预测,按照目前人工智能能力进步的速度,未来6至12个月内,类似的人工智能集群可能具备大规模控制互联网的能力,并造成数千亿美元级别的损失。
达里奥认为,2023年行业呼吁的“暂停大型AI实验”意义不大,因为当时的大模型还不具备自主行动和表现出欺骗、操纵等能力。而如今,模型已经足够强大,研究人员可以观察它们的行为模式,因此现在放慢速度,为对齐、可解释性和评估工作争取时间,可以显著降低风险。他强调,控制节奏不是暂停发展,Anthropic公司不会停止训练Claude模型,也不会退出模型竞赛,而是要在能力和安全之间找到新的平衡点。
为了实现这一目标,达里奥提出了一套三步计划。第一步是引入“嵌入式评估者”,即邀请第三方风险评估团队长期驻扎公司,拥有接近内部员工的权限,可以独立发布风险评估报告。第二步是推动民主国家内的前沿人工智能公司建立统一的安全标准,对未经充分安全验证的能力增长设置限制。第三步是寻求全球协调,包括禁止人工智能用于制造生物武器、统一测试网络安全和生物风险、给递归自我改进设置速度限制,甚至实现全球人工智能限速或暂停。
然而,达里奥的方案也面临着巨大挑战。他承认,如果Anthropic公司单独放慢速度,而其他公司继续加速发展,将面临商业上的直接惩罚。因此,他主张美国应进一步扩大对竞争对手的限制手段,先扩大领先优势,再用领先优势换取减速空间。这一观点暴露了人工智能限速方案的核心难题:所有人都意识到车开得太快,但没有人愿意成为第一个松开油门的人。
尽管如此,达里奥的呼吁还是得到了一些行业领袖的支持。OpenAI首席执行官萨姆·奥特曼(Sam Altman)公开表示赞同Anthropic提出的“前沿人工智能应该主动减速”的观点,并在近期的一次采访中确认,OpenAI公司今年不会上市,原因之一正是人工智能安全。他透露,OpenAI内部已经讨论过,每当模型进入新的能力等级时,是否应该主动暂停一段时间,让安全和对齐工作追上来。
不过,达里奥的限速论也引发了不少争议。有网友质疑Anthropic公司此时呼吁限速的动机,认为这是先抢市场再欢迎监管的策略。他们指出,一旦安全监管变成高成本合规要求,最先被挡在门外的可能是资金、算力和合规能力更弱的后来者,而OpenAI、Anthropic等头部公司反而会因此巩固优势。还有网友对人工智能公司过去几年的加速发展表示不满,认为他们现在才开始扮演解决问题的人的角色为时已晚。











