
今日凌晨,科技圈再次被一声巨响吵醒。
“世界上最智能、对齐程度最高”的模型,GPT-6 Astra来了。
前者,无可否认;后者,明显就不是事实。
具体的后面再说。
更吵的是,OpenAI总裁格雷格·布罗克曼高调宣布:AGI时代来了。
大部分人的第一反应大概都是,吹牛。
IPO压力大,吹一吹,可以理解。
但是,目前对AGI本身就没有统一定义,“进入AGI时代”与“已经完成AGI”也不是一个意思。
从OpenAI的角度出发,这次可能确实没吹牛。
01
目前,对AGI的定义主要有三个方向。
第一,实用层面。
比如,OpenAI自己的定义是:高度自主、能够在大多数具有经济价值的工作中超越人类的系统。
关键词并非“超越人类”,而是:高度自主、经济价值工作。
第二,最靠谱的,学术层面。
DeepMind提出了一个“Levels of AGI”框架,把AGI拆成性能深度、能力广度和自主性三个维度。
简单来说,AGI的形成是一个渐进式能力谱系,而不是达到什么指标后突然就成了AGI。
也可以理解为进化与基因突变的区别,AI会一点一点获得越来越强的通用能力。
所以,AGI是一个过程,而非一个节点。
这也能解释,为什么同一个模型,有人认为已经接近AGI,有人却认为还差得远。
因为他们拿的不是同一把尺子。
第三,科幻层面。
这个就不必介绍了,就是科幻电影里那种,有意识、能交流、自我迭代的机器人。

科幻层面上,GPT-6 Astra肯定远远不是AGI。
那另外两个层面呢?
先看技术指标,OpenAI这次给出的成绩单确实非常夸张:
上下文与生成极限:支持105万Token超长上下文输入窗口,单次最大可生成12.8万Token输出。
ARC-AGI-3(抽象推理):成绩达到99.9%,彻底击碎了“大模型只是概率填空”的质疑。
FrontierMath Tier 4(前沿数学):98%,甚至在测试期间协助人类数学家推演并解决了个别长期悬而未决的开放问题。
ExploitBench(网络安全攻防):100%满分,Astra在没有任何人类干预的情况下,自主发现了2个此前未知的零日漏洞,并成功构建出链式利用代码突破了高防护系统。
OSWorld 2.0(计算机自主使用/Agent能力):72.6%(上一代GPT-5.6 Sol为65.7%),在完成同等复杂的桌面与浏览器跨软件综合操作任务时,将耗时从75分钟压缩到了 40分钟,效率提升了约 47%。
……
在性能方面,GPT-6 Astra几乎全方位碾压Anthropic刚刚上线的Fable 5.1。
更关键的是,OpenAI在公告中多次出现“饱和”一词,意思就是现有的榜单测不出新模型的上限
这还真不是吹牛。

ARC Prize指出,Astra出现了一个很有意思的行为:它会把陌生环境压缩成符号化的世界模型,再根据规则进行规划。
这一行为的出现,比99.9%这个分数的意义更大。
因为ARC-AGI-3本身就是在测试“陌生环境智能”的能力。
模型面对的是一个此前不熟悉的环境,它需要自己理解规则、构建内部世界模型、规划行动,然后不断试错。
大家过去的质疑没错,大模型的本质确实就是“概率填空”,把试错后的结果呈现出来。
但现在,Astra是先理解新环境的规则,再去行动。
AI正在从“模式匹配器”向“环境建模器”转变。
这才是GPT-6 Astra真正有价值的体现,也是OpenAI为什么有底气喊出“Welcome to the AGI era”的最大底气。
从实用层面看来,不能完全否定这句话。
02
GPT-6 Astra在特定的复杂工作流中,确实展现出了极强的实用性。
OpenAI公布的数据非常直观:
在Agents’ Last Exam上,GPT-6 Astra达到59.3%,GPT-5.6 Sol为53.6%。
在OSWorld 2.0上,Astra达到72.6%,GPT-5.6 Sol为65.7%。
在ScreenSpot-Pro上,Astra达到92.7%,GPT-5.6 Sol为76.9%。
……
在法律科技公司Legora的真实财务审计测试中,Astra将财务报表处理工作流的效率提升了 40%,并且在跨越41份冗长法律文档的交叉比对中,准确找出了所有隐蔽错误。
在量化交易机构Jane Street的内部测试中,Astra不仅大幅减少了代码迭代次数,还能在发现指令模糊时主动向人类发送异步提问,并继续处理其他不依赖答复的子任务。
简单来说,GPT-6 Astra在特定赛道,真的展现出了超人的生产力。
它不再是一种“软件功能”,而是实实在在的数字劳动力。

从OpenAI自己定义的实用层面触发,GPT-6 Astra确实实现了自主、能够在具有经济价值的工作中超越人类。
称之为AGI不能说完全说错。
当然,也不完全对。
距离真正的“实用”,GPT-6 Astra依然存在很明显的缺陷。
第一,长期自主性。
它确实已经可以自主完成复杂任务,但“完成一个复杂任务”和“连续数天、数周、数月稳定地承担一个复杂岗位”,完全是两码事。
让Astra做一次性工作,它可能表现得非常优秀。
但是让它长时间面对突发情况、制度调整、数据异常、人际沟通、权限变化、目标变化,并且始终保持正确决策,就很难做到。
尽管OSWorld 2.0达到了72.6%,但在面对超过数天的开放式、无明确边界的现实业务时,Astra依然会在多步长尾调用中累积微小误差,最终导致决策偏离目标。
第二,成本。
虽然OpenAI宣称Astra在同等任务下的API成本比GPT-5.6 Sol和Claude Fable 5.1降低了 27%~31%,但在进行上百万Token上下文与上千步多工具连续调用的复杂作业时,单次任务的计算成本依然高达数十美元。
对于绝大多数工作而言,这一成本远远差过了人类的薪水,并不划算。
第三,安全。
OpenAI研究副总裁艾丹·克拉克透露,GPT-6 Astra的训练消耗了超过10万张GPU,引入了“隐式递归/循环深度”计算机制。
过去的语言模型依赖显式链式思考显式输出Token,而Astra允许模型在其内部潜在状态中进行深度递归演算,不需要把思考过程全写在屏幕上。
这不仅大幅节省了输出Token(最高减少20%),还极大地提升了多步推理的连贯性。
但是,对AI思维链的监控也因此变得极其困难。
Astra可以在许多防护严密的系统里发现此前未知的安全漏洞,并在无需人工逐步指导的情况下设计漏洞利用方式。
OpenAI自己也承认,Astra的安全监管成本极高,甚至达到了威胁级别的“临界危急”阈值。

以上,结论是什么?
从技术上、产业应用上,Astra确实表现出了OpenAI对AGI定义的特点。
只是因为无法胜任长期任务、太贵、不安全等等问题,它并不能大规模落地。
既然如此,那它其实就没有那么“实用”,当然还不能称之为AGI。
但这并不妨碍AGI时代的到来。
03
按照上面提到的DeepMind框架,AGI是一个过程,而非节点。
这其实很符合当下的情况。
真正转变不是某个人宣布“AGI已实现”,而很多原本需要人类完成的数字工作,逐渐被交给AI,而且AI真的能长期稳定地完成。
过去五年的AI革命,主要是在改造信息生产。
GPT-6 Astra确实带来了历史性的变化:AI可以直接作为劳动力使用。
只是这个“可以”,目前并非“普遍”而已。
比如Astra的公开部署,就是逐步进行中的。首先向一部分组织开放,之后才逐步扩大到Plus、Pro、Business和Enterprise用户,以及API和AWS。
包括后续的模型,当然也是如此。
所以以上讨论的一切,本身仍然是技术证明阶段,到完整的社会证明仍需要一段时间。
这一段时间,或许就是从可以到普遍的过程。
这可能才是“AGI时代”的真正含义。
不是AI突然拥有了灵魂,而是它终于开始上班了。(全文完)











