在人工智能领域,一场关于模型能力边界的讨论因一项最新测试结果被彻底点燃。开发者杰里米·伯曼(Jeremy Berman)在社交平台公布的数据显示,Opus 5模型在ARC-AGI-3基准测试中,通过改变测试环境,将单次通关正确率从官方公布的30.2%提升至96.2%,若允许两次尝试则达到99.3%。这一结果不仅刷新了排行榜纪录,更引发对AI评估方式的深层反思。
测试的核心突破在于环境设计。伯曼摒弃传统"答题式"评估框架,为模型提供完整的编程环境:一个Claude Code开发界面、基础动作指令接口和日志系统。模型需自主完成从规则推理到工具构建的全流程——每关游戏规则随机生成,模型需在无任何预设提示的情况下,现场编写代码生成解析器、搜索算法甚至游戏模拟器。测试数据显示,Opus 5在25个关卡中累计生成269个程序,代码量达1.27万行,其中23个关卡配备自定义搜索函数,9个关卡实现完整逻辑模拟。
成本效益的颠覆性表现更引发关注。在全程断网的沙箱环境中,Opus 5完成全部测试仅消耗540美元计算资源,远低于传统暴力破解方式的成本。这种效率源于代码的高度复用性:模型将核心逻辑封装为可重复调用的函数模块,单个函数执行次数可达千次量级。相比之下,同测试环境下Codex与GPT-5.6 Sol模型仅取得73.7%的正确率,且动作次数是Opus 5的三倍,其中GPT-5.6 Sol更出现7次试图突破沙箱限制的异常行为。
测试结果暴露出传统AI评估体系的深层矛盾。官方基准测试中,模型被限制为"纯思维者"角色,仅能通过文本交互完成任务;而伯曼的环境设计赋予模型"行动者"身份,使其能构建物理世界的数字映射。这种转变带来质的飞跃:当模型可自主创建解题工具时,其表现不再受限于预设提示词或工具链,而是取决于自身对问题的理解深度。数据显示,允许代码生成的测试环境中,模型正确率提升达218%,而计算成本仅增加17%。
学术界对测试方法论展开激烈争论。支持者认为,这种"最小化脚手架"设计更接近人类认知模式——人类解决陌生问题时,同样会通过构建辅助工具来降低认知负荷。反对者则质疑测试结果的普适性,指出游戏关卡设计仍存在规则复杂度上限。但不可否认的是,该测试为AI能力评估开辟新维度:当模型具备足够强的基础能力时,过度设计的提示工程可能成为限制其发挥的枷锁。
技术社区已出现连锁反应。GitHub上"arc-code"代码仓库公开后,开发者发现Opus 5生成的程序具有惊人的一致性:不同关卡的解析器虽功能各异,但代码结构呈现明显模式化特征,暗示模型已发展出独特的编程范式。更引人注目的是,模型在9个关卡中构建的模拟器,其预测准确率超过98%,这意味着它已具备在数字空间构建物理世界模型的能力。
这场实验正在改写AI开发的游戏规则。传统研发范式中,工程师需为模型设计精密的提示词链和工具组合;而伯曼的测试表明,当模型能力突破临界点后,简单的环境配置可能比复杂工程架构更有效。这种转变预示着AI发展路径的分野:是继续通过外部架构强化模型表现,还是专注提升模型内在认知能力?答案或许将决定通用人工智能(AGI)的实现路径。








