近日,OpenAI发布GPT-6 Astra模型公告后,其评测基准数据多次变动引发关注。一些更新数据显示Astra表现提升,而其最大竞争对手Anthropic旗下模型部分成绩却被下调,这一现象发生在一次颇为不寻常的公告发布过程中。
OpenAI最初计划在美国东部时间9月3日下午2点发布博客文章,然而近两个小时后,文章才被大多数用户正常访问。当地时间下午3点32分,OpenAI官方X账号发布博客链接,但页面无法打开,访问者会看到错误提示。下午3点50分,OpenAI CEO萨姆·奥尔特曼也发布链接并称部署时遇到小问题,但文章很棒。不过当时仍有多名用户无法打开页面,约一小时后页面才恢复正常访问。实际上,OpenAI在下午2点过后不久就发布了博客,随后又撤下,其表示无法披露撤稿具体原因,且强调与基准测试成绩无关,最初称是内容管理系统故障,后又表示是互联网中断所致。
博客重新上线后,多项评测数据发生变化,部分数据还继续调整,部分更新指标使Astra表现更突出。这一事件发生在人工智能行业竞争激烈之际,各公司快速更新大语言模型,围绕指标的争议凸显出如何利用标准化基准测试准确衡量大语言模型能力,以及测试成绩是否易被人为优化甚至“刷分”的问题。
OpenAI发言人称重视评测结果准确性,因模型检查点、测试框架和评测运行方式不同,多数评测结果本身会有几个百分点波动,对公告数据修正以确保能代表模型可用性能最佳估计,让用户能进行有意义比较。但首版与最终版数据存在差异,部分数字仍在变化,最引人关注的是Astra的幻觉率变化。根据互联网档案页面快照,最初版本Astra幻觉率为4.2%,之后多份快照该数字未变,直到下午3点11分第五份快照仍如此,约10分钟后OpenAI才在X上发布最终博客链接。但下午5点20分第六份网页快照中,Astra幻觉率及另外四项指标变化,幻觉率从4.2%降至2%,其前代模型GPT - 5.6 Sol幻觉率也从12.2%降至9.4%。不过OpenAI此后继续修改,截至撰写时,两者幻觉率又回到最初数值。OpenAI还大幅提高了GPT - 5.6 Sol在内部ExploitBench网络安全评测中的成绩,从5.5%提高到11.5%,目前正在研究是否恢复至5.5%,因为11.5%对应的是当前未向商业用户提供的推理能力等级。
OpenAI在公告开头强调Astra数学能力出色,从网页快照看,Astra在FrontierMath Tier 4(v2)评测成绩始终为97.6%,但OpenAI曾短暂修改GPT - 5.6 Sol和Anthropic最新模型Fable 5.1的成绩,一度让Astra明显领先。9月3日下午2点23分首份网页快照中,Anthropic Fable 5.1在该数学评测成绩为87.8%,下午5点17分下降近10个百分点至78%,截至目前回升至83%,GPT - 5.6 Sol成绩也从83%下降至80.5%,随后恢复至83%。这些数据调整甚至早于OpenAI下午2点首次发布博客前,其此前向媒体提供的预发布草稿显示Astra在ARC - AGI - 3评测成绩为98.6%,目前公开博客中变为99.99%,OpenAI回应称正式发布前验证评测结果,草稿与最终版本调整正常,还指出该基准测试创建方发现,为Astra配备特别强大测试工具框架时成绩可达99.9%,使用标准工具框架时成绩为63%,仍领先其他公开发布AI模型,且测试工具框架等因素会影响最终评测结果。
OpenAI内部不同研究团队负责不同评测指标,计算上报成绩后由中央团队统一发布。其公开承认这些数字是在最佳条件下获得,可能与普通用户通过正式版ChatGPT实际使用模型表现有差异,博客免责声明称评测分数是任何计算资源投入下能达到的最高成绩,还在每项评测指标脚注中加入更多说明和限制条件。不过评测结果“准确性”不唯一,不同测试条件可能产生多个合理成绩,一些AI专家认为可能存在“Benchmaxxing”现象,即通过反复调整测试条件、重新运行评测提高基准测试成绩,斯坦福相关研究人员Anka Reuel和Mike Hardy称这类操作短时间内可完成且对公司营销更有利,还指出GPT - 6 Astra系统卡部分内容未充分说明,如内部幻觉率评测几乎未提供评测方法细节,连测试项目数量都未列出,他们认为反复重新运行测试可能是Astra后续版本编码能力成绩略有提高的原因之一,Astra代码能力评分从57.7%提高至57.9%,OpenAI仍选择替换为更高成绩。当然,并非所有调整都让Astra更有优势,如在面向医疗领域的HealthBench Professional评测中,Anthropic两款模型成绩在不同版本间有所提高,Claude Fable 5.1成绩从56.6%提高至58.1%,Opus 5从54.5%提高至56.4%,其他AI公司模型成绩通常来自公开排行榜,OpenAI一般不会亲自重新测试竞争对手模型。
围绕基准测试准确性的争议此前多次出现,2025年meta曾否认人为提高Llama 4模型测试成绩报道,当时有报道称其公布成绩来自内部版本而非最终向公众开放版本,meta前首席AI科学家Yann LeCun后来承认公司对基准测试结果进行了“修饰”。同时,AI行业评测标准不断变化,新测试项目持续出现,如网络安全基准测试ExploitGym于2026年推出,此前该评测因OpenAI模型测试失控并对Hugging Face发起攻击受到关注。Snorkel AI负责基准测试和评估研究的AI工程师Vincent Sunn Chen称,模型发布前最后几小时内调整基准测试成绩并不罕见,通常是最终发布流程一部分,一个基准测试成绩对应一套具体测量设置,包括模型检查点、配置参数等,所有因素通常在模型发布前最后几天持续调整,他希望行业形成新规范,公司修改模型基准测试成绩时明确说明评测条件变化,以便研究人员准确理解结果。
基准测试成绩对AI公司很重要,既是衡量技术进步工具,也是与竞争对手比拼的“记分牌”,在评测排行榜上领先可吸引客户,还能帮助招聘工程师和研究人员。但正确解读基准测试成绩技术复杂,对希望简单直观展示模型能力的公司是挑战,评测数据不断变化及外界对企业展示测试结果诚实透明度的质疑,也让客户和投资者难以判断哪款模型适合哪些任务,这种混乱可能削弱OpenAI向市场传递其拥有最强大AI模型这一核心叙事,对于可能计划在2027年进行IPO的公司来说,问题更显敏感。










