在通用人工智能与AI驱动科学探索迅猛发展的当下,科技界普遍存在一种乐观预期:只要持续扩大模型参数规模、注入海量文献与实验数据,基于Transformer架构的大语言模型就能通过归纳海量数据发现新物理定律,甚至实现类似爱因斯坦的科学革命。然而,Google DeepMind资深研究员Tom Zahavy在《LLMs can't jump》论文中,通过严谨的科学哲学与物理学史分析,对这一主流范式提出根本性质疑。
论文指出,主流机器学习理论将科学发现简化为"数据压缩"过程,即通过归纳法在海量数据中寻找简洁模式。但爱因斯坦构建广义相对论的历史表明,这一理论存在根本性缺陷:在爱因斯坦提出理论时,牛顿力学并未出现显著数据误差,所谓"火神星"假说甚至掩盖了水星近日点进动的微小偏差。重大科学范式转移往往发生在没有监督误差信号的真空地带,单纯依赖数据归纳的AI系统只会拟合已知模式或引入凑数参数,无法重构全新物理图景。
研究通过皮尔士逻辑学框架揭示,当前AI系统存在结构性能力缺陷。大语言模型在归纳(从数据提炼规律)和演绎(如AlphaProof在既定公理下推导数学定理)方面已展现强大能力,但科学发明的核心瓶颈在于"溯因推理"——即通过解释异常现象提出全新公理假设的能力。爱因斯坦的"电梯思想实验"证明,科学突破需要具身仿真能力,将抽象符号锚定于物理体验之中,而LLM本质上是高维度"中文房间",仅能在已知符号间进行逻辑运算,缺乏从现实体验跨越到新公理的"飞跃"机制。
论文以爱因斯坦构建广义相对论的七年历程为案例,详细拆解了科学发明的完整循环:从自由落体感官经验(E)出发,通过概念飞跃(J)形成等效原理等公理体系(A),最终演绎出可验证的定理(S)。这个过程中,1913年爱因斯坦与数学家Grossmann的合作极具启示意义——他们虽识别出黎曼曲率张量这一关键数学工具,却因误判静态场条件而错失正确方程,这一失误恰恰证明:没有物理直觉引导的纯演绎推理必然陷入歧途。
研究进一步指出,当前AI科学系统存在双重局限。在数据层面,归纳系统在缺乏统计显著性数据时无法启动发现机制,即便面对充足数据也可能收敛于启发式捷径而非因果律;在逻辑层面,演绎系统虽能验证理论后果,却无法生成具有外部接地的公理假设。AlphaProof等系统在数学竞赛中的突破,本质上是符号操作能力的延伸,与爱因斯坦通过物理仿真形成新公理的过程存在根本差异。
论文提出,下一代AI科学基础设施必须突破"文本大模型"范式,构建具有动作可控性与反事实干预能力的物理一致性世界模型。这种交互式环境能够模拟思想实验的物理后果,为溯因推理提供合成实验室。研究特别强调,不同学科需要定制化的仿真基底:物理学依赖物质世界模型,而数学等抽象领域则需构建形式系统仿真框架。这种路径调整标志着AI科学发现从数据驱动向物理先验驱动的根本转变,为真正实现机器科学发明指明了理论方向。











