OpenAI公司近日宣布,通过改进模型运行框架,其GPT-5.6 Sol在衡量人工智能通用智能(AGI)的顶级基准测试ARC-AGI-3中取得突破性进展,得分从初始的7.8%提升至38.3%,增幅达188.42%。这一成绩是在输出Token数量减少至六分之一的情况下实现的,标志着AI模型在复杂环境中的自适应能力迈上新台阶。
ARC-AGI-3由ARC Prize团队开发,被全球AI领域公认为最严苛的交互式推理评测基准。与传统静态测试不同,该基准将AI置于完全陌生的虚拟环境中,要求其通过实时探索、学习和策略调整完成任务,更贴近人类解决新问题的思维模式。此前GPT-5.5在该测试中仅获得0.4%的得分,而GPT-5.6 Sol的初始表现也仅有7.8%。
研究团队发现,官方框架存在两个关键缺陷:一是每次动作后私有推理过程会被丢弃,导致模型需重复理解游戏规则;二是采用滚动截断窗口机制,当上下文超过17.5万字符时,早期信息会自动删除。这两种设计分别造成模型无法积累思考经验,以及丢失关键历史动作记录,严重制约了长期任务表现。
针对上述问题,OpenAI提出两项创新解决方案。在推理保留方面,通过重新实现Responses API接口,使模型能够自动关联前序响应ID,在多轮交互中持续保留推理轨迹。这项改进使GPT-5.6 Sol无需每次重新解析游戏环境,可将更多算力用于策略优化。上下文压缩技术则通过智能信息筛选机制,在保留关键历史数据的同时,将有效上下文长度压缩至原框架的六分之一,既防止信息丢失又提升处理效率。
技术验证显示,启用新框架后,模型在长时任务中表现出显著进步。使用官方原始框架时,GPT-5.6 Sol得分为13.3%;而采用推理保留和上下文压缩组合方案后,得分跃升至38.3%。特别值得注意的是,这一提升是在输出量大幅减少的情况下实现的,证明模型学会了更高效的信息利用方式。研究人员观察到,改进后的模型能够制定更连贯的策略,并随着任务推进持续优化行为模式。
这项突破揭示了"驭缰工程"(harness)在AI开发中的关键作用。该技术体系通过构建外部运行环境,为模型提供工具集成、规则约束和反馈机制,在不改变核心架构的前提下显著提升实际表现。专家比喻称,若将强大AI模型比作烈马,驭缰系统就如同缰绳与鞍具,确保其能力被安全可靠地引导至具体任务中。此次框架优化正是通过改进"缰绳"设计,释放了模型潜藏的推理能力。











