ITBear旗下自媒体矩阵:

IMO赛场新纪元:三大AI满分登顶,数学解题能力开启新篇章

   时间:2026-07-23 08:06:35 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

上海的盛夏,一场没有硝烟的数学竞赛在虚拟世界展开。第67届国际数学奥林匹克刚落下帷幕,中国队以232分蝉联冠军,三位少年更以满分成绩惊艳全场。然而,当人类选手还在庆祝胜利时,GitHub上悄然掀起另一场风暴——七个人工智能模型在完全自主状态下,向IMO 2026的全部六道题目发起挑战。

这场由前谷歌工程师Deedy Das发起的AI横评,吸引了全球科技界的目光。参赛阵容堪称豪华:Claude Fable 5以2.5小时、51美元的成本率先撞线;GPT-5.6 Sol的xhigh版本紧随其后,用时3.8小时却将成本压缩至20美元;Kimi K3虽然耗时17.4小时、花费31美元,但凭借2.8万亿参数的MoE架构展现出惊人算力。更令人震惊的是,独立参赛的AxiomProver也斩获满分,形成四强争霸的格局。

对比人类选手的表现,AI的统治力愈发凸显。过去七年,4347名人类参赛者中仅有30人获得满分,占比不足0.7%。而此次AI军团不仅全员满分,解题风格更是迥异:Claude Fable 5通过构建"每步必定缩水的计数器"完成证明,GPT-5.6 Sol采用"乘积追踪+字典序降维"的双重验证,Kimi K3则凭借海量参数进行暴力破解。在P1题目中,三个模型最终都归结到对素因子最大公约数的计算,但推导路径各不相同。

压轴的P6数论题成为检验AI深度的试金石。这道去年仅6名人类解出的难题,在AI面前却显得不堪一击:Claude Fable 5用26分钟完成证明,GPT-5.6 Sol耗时60分钟,就连最慢的Kimi K3也仅用381分钟。反观Grok 4.5的表现则令人大跌眼镜——它虽然生成了7053个token的证明文件,却始终未能完成写入操作,最终以"未完成证明"交卷,成为全场最昂贵的"白卷"。

这场竞赛的幕后推手,是年仅25岁的数学天才洪乐彤创立的Axiom Math公司。这家总部位于硅谷的初创企业,将IMO 2026的六道考题精准翻译成Lean 4形式化语言,为AI提供了可直接理解的数学命题。更令人惊叹的是,洪乐彤本人就是数学界的传奇人物:三年完成MIT数学与物理双学位,斩获Morgan Prize,去年更带领团队开发出AxiomProver,在Putnam数学竞赛中创造历史性满分。

AI在数学竞赛中的突破,正在重塑人类对智能的认知。这些模型展现出的不仅是解题能力,更是长链条逻辑推导的可靠性——从合同审查到税务合规,从保险理赔到法律论证,所有需要精确验证的领域都可能被颠覆。当AI开始掌握这种"零容错"的推理能力,专业服务的定价体系或许将面临重构。

这场竞赛留下的思考远未结束:当AI能够自主完成人类顶尖数学家的挑战,数学教育的本质是否需要重新定义?当机器证明开始占据主导,数学研究的审美标准是否会发生转变?在Axiom Math公司完成的2亿美元A轮融资背后,一个关于智能与人类关系的新命题正在浮现。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version