OpenAI最新发布的GPT-6 Astra模型引发行业高度关注。这款被公司总裁Greg Brockman称为"AGI时代起点"的模型,在发布前半个月便通过多轮信息释放积累热度,包括暂停部分前沿训练以加强安全评估等动作。目前该模型仅向少量机构开放,付费用户将在未来数日陆续获得访问权限,API接口也将分阶段启用。
新模型在核心能力上实现显著突破。基准测试显示,GPT-6 Astra在ARC-AGI-3陌生环境推理测试中取得99.9%的接近满分成绩,ExploitBench网络安全任务测试达100%,FrontierMath高阶数学推理正确率97.6%。这些数据表明模型在复杂环境适应、漏洞利用程序生成等关键领域达到新高度。不过第三方综合测试显示,其智能指数得分与前代持平,落后于主要竞争对手Claude Fable 5.1。
操作电脑能力的进化成为最大亮点。通过Computer Use技术,模型可直接读取屏幕界面并执行点击、输入等操作,形成"观察-决策-执行"的完整循环。在科研工作流测试中,任务完成率较前代提升近三倍,屏幕识别准确率从76.9%跃升至92.7%。更引人注目的是任务耗时大幅缩短,某项测试的模拟执行时间从75分钟压缩至40分钟。
实际场景测试验证了模型的长程任务处理能力。有开发者在虚幻引擎中构建曼哈顿虚拟场景,模型可持续运行多日完善建筑细节,虽完成整个纽约建模仍需数月,但展现出稳定的持续工作能力。另一组包含3D建模、游戏开发等六项测试中,模型在同时运行数百个代理实例时仍保持稳定,3D建模能力获得专业团队高度评价。
Judgment判断机制的引入优化了人机协作模式。模型可自主评估信息缺失的影响程度,对不影响最终结果的小问题自行处理,仅在关键决策点请求用户确认。这种设计显著降低了监督成本,使自动化流程能够承接更复杂的任务链。有研究员指出,这类能力正在将传统代理层的执行功能下沉至基础模型。
商业竞争格局因新模型发布产生微妙变化。GPT-6 Astra的API定价与Claude Fable 5.1持平,每百万token输入10美元、输出50美元的价格较前代上涨2.5倍。OpenAI同时推出生成速度翻倍但价格加倍的Fast Mode,形成差异化服务。企业市场成为主要战场,当前OpenAI企业客户数量突破200万,但二季度收入仍落后于实现运营盈利的Anthropic。
技术迭代背后是持续加码的算力投入。OpenAI今年计算支出预计达500亿美元,未来还将加大数据中心和芯片领域投资。面对企业客户使用习惯向复杂代理任务迁移的趋势,新模型的能力升级被视为巩固B端市场的关键举措。随着两家公司相继递交IPO申请,模型性能与企业收入的转化效率将成为资本市场的重要评估指标。










