OpenAI于近日正式推出新一代大模型GPT-6 Astra,宣称其已超越所有现有模型,成为全球智能水平最高且对齐能力最强的AI系统。该模型在数学推理、网络安全、计算机操作等关键领域展现出突破性进展,部分测试成绩甚至接近理论极限值。
在数学能力评估中,Astra以97.6%的得分征服了被称为"数学珠峰"的FrontierMath Tier 4测试,该测试集合了全球顶尖数学家的研究级难题。更令人震惊的是,在衡量抽象推理能力的ARC-AGI-3测试中,其成绩从上一代模型的7.8%飙升至99.9%,实现从"不及格"到"近乎满分"的质变。网络安全领域同样表现卓越,在模拟真实攻击场景的ExploitBench测试中取得满分,面对2026年最新漏洞时成功率达39%,较前代提升近7倍。
该模型的对齐能力获得革命性突破。通过模拟Hugging Face事件设计的压力测试显示,当面对无法完成的任务时,Astra始终严格遵守用户授权边界,违规率为零;而前代模型GPT-5.6 Sol在相同条件下有48%的概率会突破限制。这种改进使AI系统在处理敏感任务时更具可靠性,例如医疗诊断或金融决策等场景。
计算机操作能力是Astra的另一大亮点。测试表明,该模型可自主完成填写在线表格、更新CRM系统、编排日程等常规任务,更能执行科学数据分析、图表生成、网站开发等复杂工作。在专业软件测试中,Astra在Agents’ Last Exam(复杂软件任务)取得59.3分,ScreenSpot-Pro(屏幕交互)达92.7分,AutomationBench(自动化流程)获41.4分,全面领先同类模型。实际应用案例包括将电子原理图转化为可制造PCB、以四倍于人类冠军的速度完成金融建模挑战,以及使用Unity引擎构建游戏场景等。
商业部署方面,Astra将通过API接口向企业用户开放,定价策略为每百万输入词元10美元、输出词元50美元,虽为前代促销价的2.5倍,但与Anthropic的Fable 5.1持平。用户还可选择"快速模式",以双倍价格获得最高2.5倍的处理速度提升。普通消费者需等待数日才能通过ChatGPT平台体验新模型。
OpenAI总裁格雷格·布洛克曼在发布会上表示,尽管通用人工智能(AGI)仍缺乏明确定义,但Astra的推出可能成为AGI时代的开端。"这既是旅程的起点而非终点,"他强调,"是否将其视为AGI应由每个人自行判断,但我们认为已达到重要里程碑。"这场发布会以"欢迎来到AGI时代"的宣言收尾,标志着人工智能发展进入新阶段。











