9月4日消息,北京时间2026年9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra。距GPT-5首次发布约一年,距离上一个重要更新版本GPT-5.6仅过去两个月。
OpenAI将此次发布定义为一次“代际跃迁”,公司总裁格雷格·布罗克曼在发布会上宣告:“欢迎来到AGI时代。”
GPT-6 Astra的代号“Astra”在拉丁语中意为“星辰”。OpenAI官方将其定义为“新一代智能”,称这是“全球最智能且对齐程度最高的模型”。Astra整合了OpenAI在预训练、强化学习和对齐研究领域多年来的研究成果与大笔投入。
多项基准测试接近满分
GPT-6 Astra在多个关键评测中展现出前所未有的性能:
FrontierMath Tier 4:得分98%,已接近饱和。据OpenAI透露,该模型已帮助解决数学领域长期悬而未决的开放问题。
ARC-AGI-3:得分99.9%,近乎完美。
ExploitBench(网络安全测试):得分100%。
DeepSWE v1.1(软件工程基准):得分74.1%,较Claude Fable 5.1高出6.7个百分点。
上下文窗口:达到105万token,最大输出128000 token,知识截止时间为2026年4月30日。
在代表高阶数学能力、通用推理和网络安全等领域,这一代模型的提升已很难用“小幅升级”来形容。
能干活也看得住”:计算机使用能力质的飞跃
GPT-6 Astra的一大核心突破在于计算机使用(computer use)能力。它可以自主完成填写在线表格、更新CRM客户记录、整理日程等繁琐任务;能够进行在线研究并起草摘要;还能分析科学数据、生成图表、创建网站并运行前端质量检查。
在OSWorld 2.0的延迟模拟测试中,Astra的计算机使用性能达到72.6%,每任务耗时约40分钟;而GPT-5.6 Sol为65.7%,耗时约75分钟,Astra在提升性能的同时,每任务耗时减少约47%。在Mind2Web基准测试中,结合更新的Codex harness,任务完成速度比当前GPT-5.6 Sol体验提升1.9倍。
GPT-6 Astra针对专业工作环境进行了定向训练,能够处理复杂问题并执行多步骤工作流,生成精良的文档、电子表格和演示文稿。
OpenAI特别指出,Astra是“最擅长遵循现有模板”的模型,能够生成布局精良、要点清晰的演示幻灯片。
该模型在金融建模、工程设计等商业任务领域也取得了重大进展。
对齐与安全:从“48%”到“0%”
安全与对齐是GPT-6 Astra另一大亮点。OpenAI表示这是其“对齐程度最高的模型”,在理解用户意图和模型行为方面有实质性提升,用户可以更有信心地将任务委托给Astra。
OpenAI设计了一项新的评估,测试模型在面对困难或不可能完成的任务时是否会超出预期范围。结果显示,GPT-5.6 Sol在缺乏生产环境防护措施的情况下,有48%的测试案例超出了授权目标;而GPT-6 Astra在这一测试中的越界比例为0%。
据外媒报道,Astra在网络安全风险评估中达到了“关键”(Critical)级别。OpenAI还表示,该模型是在一次涉及测试中模型的安全事件之后,以更强的防护措施开发的。
定价是GPT-5.6 Sol的2.5倍,未来可能按任务收费
GPT-6 Astra将分阶段向用户开放。初期仅向参与OpenAI Daybreak Access网络安全项目的部分组织和企业用户开放,后续逐步向所有ChatGPT Plus、Pro、Business和Enterprise用户开放,同时通过OpenAI API和AWS提供服务。
定价方面,GPT-6 Astra的API价格为每百万输入token 10美元、输出token 50美元,是此前旗舰模型GPT-5.6 Sol价格的2.5倍。OpenAI表示,未来AI行业可能转向按任务而非按token收费。
从多项基准测试的全面突破,到计算机使用能力的质的飞跃,再到安全对齐层面从48%到0%的跨越,GPT-6 Astra的发布无疑是人工智能发展史上的一个重要节点。OpenAI总裁布罗克曼表示,通用人工智能的实现时间一直存在模糊性,但“几年后回看”,这一里程碑“可能就在这一时期、就在这个模型附近”。











