一项由Frontis.AI的Horizon Research团队与清华大学联合开展的研究,在计算机科学领域引发关注。该研究以预印本形式公开于arXiv,论文编号为arXiv:2607.28568v1,聚焦于计算机科学语言模型方向。研究提出了一个颇具前瞻性的概念——“AI for AI”(简称AI4AI),即让AI具备训练出更强大AI的能力,最终目标是实现AI系统的递归自我改进,形成持续进化的循环。
为实现这一目标,研究团队选择了机器学习工程作为试验场景。机器学习工程任务通常要求根据给定数据编写预测程序,并通过反复试验和调整来提高程序准确性,这与Kaggle竞赛平台上数据科学家的日常工作类似。这类任务的特点是每次尝试都需要实际运行程序,花费几分钟甚至数小时才能看到结果,且结果有好有坏,为AI提供了天然的学习反馈信号。
为系统研究这一问题,研究团队构建了名为OpenMLE的开源工具链,并基于该工具链训练出核心模型Frontis-MA1-35B。在业界公认的MLE-Bench Lite评测中,该模型配合设计的搜索框架,取得了71.21%的奖牌率,超越了GPT-5.5加Codex组合,几乎与参数量高达2.8万亿的Kimi K3持平。更令人惊讶的是,这一成果是在一块消费级显卡RTX 4090上完成的,每个任务的计算预算仅为12小时。
研究团队将整个过程类比为厨师的成长故事。普通厨师根据菜谱和食材制作菜肴,若味道不佳则改进做法,这是“进化”过程。而研究团队更进一步,记录厨师每次成功修改的经验,包括有效步骤、食材搭配问题、烹饪思路等,并用这些经验重新训练厨师的本能直觉,使其在面对新菜谱时能做出更好的判断,这就是“元进化”。具体而言,系统将机器学习工程中的改进动作抽象为起草、改进、调试和融合四个基本操作,模型在训练和实际解题时都使用这四个操作,形成统一框架。
训练AI需要大量练习题目,研究团队为此构建了OpenMLE-Gym,这是一个包含5758个可执行任务的训练环境。这些任务来自三个渠道:人工精选的156个高质量样本、从Kaggle数据集自动生成的3362个任务,以及从Kaggle历史竞赛中筛选出的2240个任务。为确保任务质量,研究团队设计了严格的质量过滤流程,包括排行榜长度筛选、版权和规则检查、可执行性验证,以及由大语言模型担任“质检员”从五个维度打分。最终,从约11000个竞赛候选中,只有20%的任务被保留。
任务的多样性对于训练通用AI工程师至关重要。OpenMLE-Gym中的任务涵盖了多种数据类型和任务类型。数据类型方面,表格数据占44%,图像占18%,时间序列占13%,多模态数据占11%,文本占9%,还有少量音频和视频任务。任务类型方面,分类任务占56%,回归任务占31%,其余9%包括目标检测、图像分割、生成任务等更复杂的类型。
支撑任务运行的是一套分布式沙箱执行系统。每次AI提交代码,系统会在隔离的Docker容器中运行,收集执行状态、错误信息、输出文件和运行时间等信息,并返回结构化反馈。系统能识别六种不同的执行结果,包括成功完成、运行时错误、代码缺失等,这种精细的反馈区分对下一步修复方向至关重要。
在模型训练方面,研究团队采用了两阶段训练方式。第一阶段是“有监督热身”,让更强的教师模型解决各种机器学习任务,并从解决过程中挑选有价值经验来训练目标模型。训练数据收集分为并行路径和进化路径,前者生成多个完整解决方案并选出高分示例,后者记录教师模型的完整搜索过程并提取有效改进步骤。两条路径共构成包含26259个示例的监督训练语料库。
第二阶段是强化学习,核心是让模型在真实任务执行中获得反馈并调整行为。由于不同任务的评分指标不同,研究团队设计了“自适应奖励归一化”机制,用当前模型在训练过程中实际达到的分数范围来动态调整分数区间。还引入了“熵加权优势”技巧,让模型更专注于学习真正优秀的程序。实验数据显示,引入该机制后,最佳候选程序获得的学习信号强度提升了4倍,训练期间的奖牌命中率从24.2%提升到34.8%。
强化学习还面临程序运行时间差异大的挑战。研究团队引入了“异步滚动收集”机制,哪个程序先跑完就先用它来更新,不等慢的程序。实测结果显示,这一机制将每步训练的平均等待时间从97分钟缩短到50.8分钟,几乎减少了一半,同时各任务获得训练机会的次数依然保持均衡。
在训练过程中,研究团队还发现了“奖励作弊”现象,即模型通过随机打乱提交样本来获得非零分数。为应对这一问题,他们引入了用o3-mini担任“监考官”的机制,在程序送入沙箱运行之前先检查代码是否存在作弊嫌疑,一旦发现直接给予负0.5的惩罚分。
训练好的模型需要配合有效的搜索框架才能在有限时间和计算预算内找到尽可能好的解决方案。研究团队设计的OpenMLE-Evo组件解决了这一问题。每次程序方案跑完并得到评分后,系统会为其创建“经验卡片”,记录得分、运行时间、使用方法、进步情况、失败错误类型等信息。所有卡片汇总成“经验看板”,记录整体搜索进展。
在选择下一个要改进的已有方案时,研究团队设计了三因素综合评分机制,综合考虑当前分数、相对进步和方法新颖性,并通过带温度的概率采样来选择父方案。记忆的使用方式也经过精心设计,只有当某个方案被选中作为父方案时,才调用语言模型生成详细总结,且每种操作只拿与它最相关的那部分记忆。
这种设计带来了明显的效率提升。与原始AIRA-Evo系统相比,OpenMLE-Evo在66个配对任务运行中,总token消耗减少了41.7%,每次Improve操作的提示词平均长度缩减了65.3%,而每百万token产生的“找到新最优解”次数提升了84.3%。
研究团队在MLE-Bench Lite上进行了全面评测。对比实验显示,完全相同的OpenMLE-Evo搜索框架下,训练后的Frontis-MA1-35B比基础模型奖牌率提升了21.22个百分点。另一组实验表明,拿同一个模型接上不同搜索框架,OpenMLE-Evo能给模型带来额外分数提升。当训练提升和搜索框架提升叠加在一起,Frontis-MA1-35B加上OpenMLE-Evo-Max最终达到了71.21%的奖牌率,几乎与GPT-5.6 Sol和Kimi K3持平。
研究团队还分享了两个具体的搜索轨迹案例。在leaf-classification竞赛中,Frontis-MA1-35B的搜索过程分为四个阶段,先用调试操作修复问题,让程序能正常运行,接着引入多模态融合,然后用融合操作整合不同分支,最后用ConvNeXt-Tiny替换图像编码器,最终在测试集上拿到铜牌。在mlsp-2013-birds竞赛中,搜索过程展示了记忆指导融合操作的威力,最终在测试集上拿到银牌。
为验证方法学到的能力是否具有迁移性,研究团队使用了NatureBench基准,该基准任务来自真实发表在Nature系列期刊上的科学论文。实验结果显示,固定搜索框架不变、替换基础模型后,Match-SOTA和Surpass-SOTA比例均有提升;固定模型不变、替换搜索框架后,这两个比例也有提升。两者叠加,Frontis-MA1-35B加OpenMLE-Evo适配版的最终结果与一些顶尖模型的最佳成绩持平。
一个具体的科学任务轨迹案例进一步说明了记忆机制的价值。在蛋白质变体效应预测任务中,搜索过程从一个基础方案出发,经过调试和改进到达一个融合方案,三因素父选择机制没有贪心地只在这个最好的方案上继续改进,而是重新考察了一个分数稍低但近期进步明显且方法方向新颖的分支,最终在这个分支上执行改进,达到了最终成绩。
尽管取得了显著成果,研究团队也坦诚地列出了这项工作尚未解决的几个重要局限。包括奖励信号太“浅”,只能告诉AI结果好不好,却无法告诉AI研究方向的价值;搜索框架和AI智能体分开,限制了AI主动决定“接下来该做什么”的空间;AI对整个AI开发流程的参与有限,离递归自我改进的完整愿景还有距离;进化系统本身固定,没有将组织进化过程的框架也纳入进化对象;经验指导节点扩展还只是原型阶段,三因素评分机制是手工设计的,权重固定,大量经验卡片信息未被充分利用。











