GPT-5.6近日完成了一项关键任务——自主优化OpenAI线上生产环境的底层代码,显著提升了系统运行效率。这项突破性进展使OpenAI对外服务成本降低20%,模型生成token的效率提升超过15%。此次优化并非针对演示环境,而是直接作用于每天处理十亿级用户请求的核心生产系统。
OpenAI通过两步策略实现这一目标:首先训练出具备强大能力的模型,随后利用该模型优化自身运行的基础设施。GPT-5.6通过Codex接入生产推理栈,对GPU内核、负载均衡、推测解码和KV缓存等核心模块进行深度优化。在负载均衡方面,模型通过分析真实流量数据,重新设计路由策略,避免硬件资源闲置;在KV缓存优化中,系统存储中间计算结果以减少重复运算;推测解码技术则通过小模型快速生成候选答案,再由大模型验证,大幅提升输出效率。
具体实施过程中,GPT-5.6自主重写了采用Triton和Gluon编程语言编写的生产内核,通过并行化计算和跳过冗余步骤提升性能。在推测解码环节,模型针对配套的draft模型进行了数百次架构实验,自动调整模型尺寸和结构,并全程监控训练流程,及时处理硬件故障和不稳定因素。这些优化措施共同作用,最终实现了服务成本与生成效率的显著改善。
这项突破的意义不仅在于数字提升,更在于构建了一个完整的优化闭环。模型现在能够独立完成从流量分析、代码编写到实验验证的全流程,形成"决策-执行-验证"的循环机制。以推测解码为例,过去需要工程师手动调整数百个配置参数,耗时数月且难以覆盖所有可能性;如今模型可在短时间内完成更多实验,快速适应动态变化的负载需求。
内部数据显示,GPT-5.6内测阶段研究员日均token输出量较前代模型翻倍,代码推理算力占比增长100倍,智能体token使用量激增22倍。这种效率提升使OpenAI能够用相同硬件资源服务更多用户,形成"优化-扩容-更强模型"的良性循环。公司通过推出Sol、Terra、Luna三档模型,在保持智能水平的同时显著降低token消耗成本。
尽管OpenAI官方使用"自主"描述此次优化过程,但强调关键决策仍由工程团队把控。模型编写的代码需经过FpSan浮点验证工具检查,确保结构与数据流正确无误。这种受控的自主优化模式,为未来实现更复杂的递归自我改进奠定了基础。公司内部RSI指数显示,GPT-5.6在自我改进能力上较前代提升16.2分,在相同性能下成本更低。
行业观察人士指出,AI领域竞争焦点正从硬件规模转向资源利用效率。当算力增长难以满足需求增速时,如何通过优化提升单位硬件产出成为关键。GPT-5.6的实践表明,模型自身可以成为优化推理栈的重要力量,这种"自我优化飞轮"的启动,标志着AI发展进入新阶段。











