一项由国内顶尖高校与科技企业联合完成的人工智能研究引发学界震动。这项发表于国际知名学术平台的研究,首次将拥有万亿参数的超大语言模型应用于复杂数学竞赛题的自主解答,且全程不依赖任何人工标注的解题步骤。研究团队通过名为"Ring-Zero"的训练框架,验证了当模型规模突破临界点后,高级数学推理能力会如"涌现现象"般自然产生。
传统AI训练依赖大量人工标注数据,例如需要专家详细写出每道题的解题步骤供模型模仿。而此次研究采用的"零强化学习"技术彻底颠覆了这一模式——模型仅通过题目对错的结果反馈进行自我修正,如同人类学生通过反复试错掌握知识。实验中使用的Ling-2.5-1T-Base基座模型虽采用混合专家架构,实际激活参数约630亿,但总体规模仍远超现有公开模型。
对比实验揭示了模型规模的决定性作用。同时训练的1040亿参数"闪速版"模型,在相同训练步数下数学竞赛得分显著低于万亿参数版本。这种差距随着训练推进持续扩大,印证了AI领域"规模至上"的争议性观点——当计算资源足够庞大时,精心设计的人工规则往往不及简单扩大规模有效。
研究团队将训练过程分解为四个精密调控的阶段。初期通过"裁剪重要性采样"技术,刻意放大模型探索非常规解题路径时的学习信号,配合"按词计奖"机制鼓励详细推理。随后采用"自我蒸馏"技术,让模型生成的答案经过筛选压缩后再重新学习,既保留核心能力又消除冗余。第三阶段改为"按题计奖"稳定输出质量,最终通过难度分级训练使模型学会根据题目复杂度动态调整推理深度。
工程实现层面面临双重挑战。为解决低精度计算导致的训练信号失真,团队在关键计算层采用混合精度控制,使数值误差降低三个数量级。针对超长文本的并行计算问题,定制开发的通信策略使320块GPU的协同效率提升40%。这些技术突破使得持续强化学习在万亿参数规模下成为可能。
训练数据记录显示模型能力增长呈现独特"两段式"特征。初期pass@1024指标(1024次尝试中至少答对一次的概率)快速上升,表明模型在探索新解题方法;后期该指标趋于稳定,而pass@1(首次尝试正确率)持续提升,反映模型将已有能力打磨至极致。这种成长模式调和了学界关于强化学习是拓展能力还是巩固能力的长期争论。
最令研究团队意外的是模型自发产生的五种高级思维策略。在未作任何专项训练的情况下,模型不仅会像人类一样使用"等等,这里可能出错了"等情绪化表达,还能自动将推理过程结构化为清晰步骤。面对复杂问题时,模型会同时展开多条解题路径并交叉验证,甚至在计算资源即将耗尽时主动切换为有根据的猜测策略。这些行为在较小规模模型上完全不会出现。
评估体系创新性地引入三个维度:可理解性测试显示Ring-Zero的推理链在逻辑连贯性上全面领先其他顶尖模型;可复现性实验证明,用其推理数据训练的弱模型能力提升幅度比使用传统数据高出40%;效率对比中,Ring-Zero解答同样题目的平均词数仅为竞争对手的40%。在七个国际数学竞赛基准测试中,最终版本模型得分与GPT-5.5等专有商业系统持平,且完全不依赖人工标注数据。
研究也暴露出当前技术的局限性。"长度惯性"现象显示,按词计奖训练会导致模型对简单题也过度展开推理;数据分布实验表明,按自然难度比例训练会降低学习效率;最根本的限制在于,零强化学习无法创造预训练数据中不存在的数学概念。这些发现为后续研究指明了方向——如何在保持自主性的同时突破数据边界。











