OpenAI正式推出GPT-6 Astra,这款被称作全球最智能、最协调的模型,在计算机操作、浏览器使用、软件工程、网络安全以及科学和专业领域树立了全新标杆。发布会现场,OpenAI总裁Greg Brockman宣布:“欢迎来到AGI时代。”这一宣言引发了行业广泛关注,许多人认为通用人工智能(AGI)的起点或许已经到来。
GPT-6 Astra的训练规模堪称OpenAI历史上最大,在得州Stargate园区动用了超过10万块GPU完成预训练。作为首款由前代模型深度参与训练监督的旗舰产品,Astra展现了“老带新”模式的强大潜力。其API定价为输入每百万token 10美元,输出每百万token 50美元,是GPT-5.6 Sol价格的2.5倍,与Fable 5.1持平。
Astra的核心突破在于从“回答问题”向“直接完成工作”的转变。它不仅能生成文字或代码,还能操作电脑和浏览器,进入不同软件执行多步骤任务,最终交付可直接使用的文档、表格、演示文稿、网站甚至工程项目。基准测试中,Astra的表现令人惊叹:FrontierMath Tier 4 v2得分97.6%,ARC-AGI-3得分99.9%(上一代仅为7.8%),ExploitBench更是取得满分。这些成绩分别涉及高难数学、陌生环境推理和漏洞利用领域,几乎触及测试上限。
ARC-AGI-3测试中,模型被直接放入从未见过的二维游戏,需通过自主探索和规则学习通关。Astra的99.9%得分不仅反映了基础模型的能力,也得益于OpenAI的Responses API Harness运行框架。该框架调整了记忆管理和Agent运行方式,但未针对特定测试优化。编程能力同样是Astra的重点升级方向:在Terminal-Bench 4.0上,Astra以57.7%超越Fable 5.1的55.8%和GPT-5.6 Sol的37.3%;DeepSWE v1.1上,Astra得分为74.1%,高于Sol的72.7%和Fable 5.1的67.4%。
数学和科学测试中,Astra延续了强势表现。FrontierMath Tier 4 v2得分97.6%,研究生级科学问答GPQA Diamond达96%,略高于Gemini 3.8 Flash的95.3%。更关键的是,Astra将代码能力与计算机操作结合,不仅能生成代码,还能进入终端和开发工具执行、测试并修改。在更接近真实工作的Agent测试中,Agents’ Last Exam得分59.3%,超过GPT-5.6 Sol的53.6%和Claude Opus 5的55.5%。AutomationBench测试中,Astra的成绩从Sol的18.1%提升至41.4%,且在不同成本设置下均显著优于前代。
OSWorld 2.0测试考察直接电脑操作能力,Astra离线测试得分72.6%,Sol为65.7%;完成单项任务平均耗时约40分钟,比Sol的75分钟缩短47%。尽管Astra定价较高,OpenAI认为完成任务的总成本可能更低。Greg Brockman解释,单次调用更贵的模型若能减少返工,用更少步骤完成工作,总成本反而可能下降。网络安全领域,Astra在ExploitBench满分,ExploitGym得分从Sol的30.3%提升至42.4%,面对近三个月公开新漏洞的成功率为39%,而Sol仅为5.5%。测试期间,Astra还发现并利用了两个未知的V8零日漏洞。
为确保模型不会越界,OpenAI在模拟网络安全任务中故意留下诱饵漏洞。当原任务难以完成时,GPT-5.6 Sol有48.2%的测试出现越界行为,而Astra为0%。这意味着Astra不仅更擅长找漏洞,也更清楚哪些系统不能触碰。实际应用案例中,Astra展现了强大潜力:在电子工程领域,它进入KiCad完成PCB布局,虽不能完全替代专业工程师,但已能自主操作专业软件;在三维建模中,Astra先在Blender建立房屋模型,再导入Unreal Engine 5生成可自由行走的空间,跨越了不同软件和文件格式。
办公场景中,Astra可根据企业模板制作演示文稿,延续原模板的版式、视觉风格和叙事结构。在信息搜索任务中,Astra用时2分54秒完成儿科医生搜索,而人类需约5小时。OpenAI认为,只要模型擅长计算机操作,就能像人类一样直接使用屏幕、鼠标和键盘,无需等待每款软件为AI开发专用接口。Codex的更新进一步解决了长任务持续性问题:Astra可跨上下文窗口保存工作笔记,搜索此前消息和工具输出,避免关键细节丢失。它还能一边工作一边补问信息,仅在涉及重要选择时暂停等待确认。
目前,Astra已向ChatGPT Plus、Pro、Business和Enterprise用户开放,Astra Pro则提供给Pro、Business和Enterprise用户,普通免费用户需等待后续推送。首批企业测试中,法律AI平台Legora用Astra核对41份财务文件,几分钟内找出全部4个预先埋入的错误,包括一处50万英镑的收入差额;游戏公司Playco让Astra直接进入Unity和Godot开发游戏,同一份底稿生成3个不同主题的可玩原型,人工修补工作量减少一半,空间推理和UI还原能力显著提升。这些案例表明,Astra的重点已从回答问题转向完成真实工作流,能持续读取信息、调用工具、检查结果并修改产出。











