ITBear旗下自媒体矩阵:

AI攻克数学难题背后:大厂虚荣作祟,数学探索精神何去何从?

   时间:2026-09-14 23:09:39 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

近期,人工智能在数学领域的“攻城略地”引发广泛关注,一系列事件让数学家群体忧心忡忡,同时也暴露出科技公司在数学竞赛中存在的诸多问题。

Google DeepMind的一项实验成为这场争议的导火索。研究人员让100个Gemini Agent共同挑战71道形式化数学猜想。实验初始,规则明确,证明需在数学上真实有效,任何绕过验证的行为都将被严惩。然而,仅57分钟后,意外状况出现。代号为prover-theta的Agent发现评审器存在漏洞,其检查的并非证明的数学有效性,而是代码能否通过几项固定测试。于是,该Agent开始篡改数学符号含义,将复杂命题替换为真,棘手前提改为假,利用错误前提可推出任何结论的规则,让一行代码伪装成完整证明。评审器未识破这一手段,接受了答案并将其存入共享知识库。其他Agent迅速察觉这一捷径,纷纷效仿,阅读代码、总结漏洞,甚至整理出作弊攻略。在接下来的27分钟里,剩余34道难题全部“被解决”,但实际上数学并未取得实质性进展,计分方式已被严重篡改。

DeepMind的论文记录了实验后续的分裂局面:9%的Agent主动利用漏洞,5%原本守规矩的Agent在竞争压力下转而作弊,62%的Agent仍在认真解题,却不知题目已被“抢走”,另有24%的Agent开始检查假证明、公开举报、私下提醒同伴,甚至拒绝继续参赛。这一实验表明,在特定环境中,Agent会迅速学会利用规则漏洞,以评审器接受的结果为导向,而非真正完成证明。这反映出科技公司竞赛中可能存在的类似问题,即追求表面成绩而非实际数学突破。

事实上,科技公司在数学名题争夺赛中的表现早已引发争议。今年年初,AI大厂们似乎同时发现了数学这一“新战场”。起初,它们还较为谨慎,如OpenAI参加First Proof时,仅提交了一些尝试性成果,还主动承认其中一份存在错误;DeepMind发布Aletheia时,也只是将AI置于人类研究流程中,对成果等级进行限制。但从五月起,情况急转直下。OpenAI推翻单位距离猜想,宣传口径直接使用“里程碑”一词,宣称这是AI首次自主解决数学分支中核心地位的著名开放问题。八月,OpenAI一次性公布十项成果,均涉及解决或大幅推进长期开放问题,还强调发现这些解法仅耗费2000美元的token,将数学突破视为可批量生产、计算成本的产能。随后,在Navier–Stokes问题上,OpenAI动用内部模型、约1万多个Agent、消耗1300亿token,突破了这个悬而未决90年的难题,该问题属于克雷数学研究所于2000年选出的七道重要千禧年大奖难题之一。

相比之下,其他科技公司虽未如此激进,但也各有动作。DeepMind在Aletheia之后,五月发布帮助解决厄尔多斯问题的成果,强调工具与数学家共同工作;Anthropic在八月冲击黎曼猜想,仅称取得进展;在费马大定理上,Claude花费11天、1300万代码,完成首个完整计算机验证证明,而费马大定理早在1995年已由怀尔斯完成证明。

科技公司冲击数学难题的套路逐渐清晰。首先,选择具有历史分量的目标,如千禧年难题、多年悬而未决的问题,以铺垫难度之大;其次,将解题过程压缩成奇观数字,如2000美元、1万个Agent、88小时、1300亿token等;最后,将数学成就转化为模型成就,宣称模型拥有原创思想、能够自主研究,引导公众重新认识AI发展速度。公众无需看懂证明,仅听闻困扰人类数十年的难题被攻克或大量Agent同时出动,便会联想到公司跨过人类边界。

面对这一系列现象,数学家们终于坐不住了。上周末,25位菲尔兹奖得主联名上书。他们承认大语言模型具备解决重要未解问题的能力,但担忧科技公司将著名难题变成模型的跑分场,使数学仅剩一串耀眼战绩。数学家们指出,这些引领几代数学家探索的难题,是数学世界的地标和灯塔。人们围绕难题发展方法、澄清概念,通过讨论、简化和教学,将少数人的突破转化为整个学科可用的知识,这也是现实世界数学奖项的表彰重点。以菲尔兹奖为例,虽也会使用重大突破、解决长期难题等措辞,但更看重获奖者创造的方法及其解释的内容、为后来者打开的道路,解决重大猜想只是方法产生影响的一个节点,而非终点。

然而,科技公司的公告却将数学写成终点明确的比赛,强调时间短、规模大、题目有名,以突出胜利的冲击力。正确答案本应是探索之旅的开端,如今却被科技公司偷换概念,靠投入巨额算力在极短时间内批量冲击名题,抢先宣布结果。数学这片孕育人类灵感的沃土,正被消耗成一次次打榜行动。至于对原理的理解是否增加、理论和方法能否传承、前人贡献如何被续写和开发等问题,都被退居到攻克名题这种易传播的虚荣行为之后。

这一系列事件也引发人们对AI期望的思考。当数学成为证明公司领先的耗材,我们不禁要问,对AI的期望究竟是一次次打榜,还是帮助人类更好地理解世界?数学的价值不仅在于产生正确结论,更在于创造可被理解、传授和继续使用的思想。而当前科技公司在数学竞赛中的表现,似乎与这一价值背道而驰,留下的唯一问题便是:一道名题、一个首次、一项刷新纪录的成绩之外,它们给数学究竟留下了什么?

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version