ITBear旗下自媒体矩阵:

华为加拿大等高校联合研究:小模型MindForge如何逆袭编程大模型?

   时间:2026-08-08 00:42:36 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在编程领域,让AI从零开始构建一个功能完备的程序,一直是极具挑战性的任务。即便对于当前最先进的AI编程模型而言,在无源代码参考的情况下,仅依据功能文档和编译好的可执行程序来重新编写程序,成功率也极低,不足1%。不过,华为加拿大研究院联合女王大学、曼尼托巴大学以及康考迪亚大学的研究团队,提出了一种名为MindForge的方法,显著提升了AI在这方面的能力。

研究团队以预印本形式在arXiv平台发布了相关论文,论文编号为arXiv:2607.27146,预计于2027年AAAI会议上正式展示。他们通过一系列精心设计的训练技术,将一个270亿参数的“小”模型Qwen3.6 - 27B在ProgramBench测试基准上的得分从37.98%大幅提升至49.51%。这一成绩不仅超越了参数量是其数倍乃至数十倍的大型前沿模型,如1.6万亿参数的DeepSeek V4 Pro,还与参数量未公开披露但规模远大于27B的Claude Opus 4.7处于相近水平。而且,这种能力提升并非局限于特定任务,而是延伸到了七个不同的软件工程测试场景,涵盖代码错误修复、跨语言翻译等多个领域。

要理解MindForge的价值,需先明白“从零编写程序”的难度所在。现有的AI编程助手,大多擅长“修缮旧房子”,即对已有代码库进行局部修改,如修复bug或添加新功能。这类任务有现有代码作为“脚手架”,AI只需在框架内调整。而“从零编写程序”则要求AI独立完成软件开发的完整生命周期,包括规格推断、设计、实现、错误定位与修复以及测试等阶段。每个阶段都可能出错,且早期错误会导致后期难以纠正,同时现有训练数据也缺乏对完整开发过程的覆盖。

MindForge的核心思路是打造“无源码训练场”。研究团队从GitHub的命令行工具程序“精选列表”社区出发,筛选出2235个候选代码仓库,再由“探索智能体”逐一审查,判断其是否适合作为训练环境。筛选标准严格,程序需是自包含的命令行工具,行为可明确验证且能在本地完成有意义的工作。经过筛选,1206个程序通过初审,其中1002个成功编译打包。接着,“构建智能体”为每个通过初审的程序生成构建脚本,并在全新沙箱环境中验证其可复现性。最后,通过“无源码检验”,确保可执行文件中无原始源代码残留。最终,研究团队建立了562个有效的无源码训练环境,覆盖Go、Rust、C、C++、Swift和Typescript六种编程语言,且这些程序与ProgramBench测试集不重叠。

有了训练场地,研究团队选用在ProgramBench上得分64.60%的GLM - 5.2作为“教师模型”,将其置于562个无源码环境中,像真实开发者一样工作,记录下完整的开发轨迹。只保留教师模型最终成功产出可执行文件并发出“任务完成”信号的轨迹,过滤掉中途失败的尝试。最终收集到1001条完整的开发轨迹,这些轨迹规模大,平均每条包含181.6个对话回合、约177000个token,最长的一条包含477个回合、272000个token,且覆盖了完整的软件开发生命周期。

原始收集到的轨迹存在噪音,研究团队设计了两套轨迹净化机制。一是“基础设施噪声恢复”,当运行环境出现问题导致轨迹中断时,回到最后一个健康状态点,在全新干净环境中重新执行之前的工具调用步骤,从中断点继续让教师模型运行,避免重复推理成本。二是“推理重写机制”,当教师模型产生格式错误的工具调用时,删除错误步骤和报错信息,识别出后续的“孤儿推理”段落,用GLM - 5.2重写,使其与清理后的轨迹语境连贯,同时确保不改动工具调用和环境响应。

用经过净化的973条训练轨迹对Qwen3.6 - 27B进行微调后,得到MindForge - 27B模型。在ProgramBench的200个测试任务上,其平均测试通过率从37.98%跃升至49.51%,在152个任务上得分高于基础模型,只在43个任务上得分较低,5个任务持平,实现了系统性的能力提升。与参数量是其数十倍乃至数百倍的模型相比,MindForge - 27B也表现出色,不过与教师模型GLM - 5.2以及GPT - 5.5等顶尖前沿模型仍有差距。

为验证模型能力的泛化性,研究团队准备了七个独立的评测基准,涵盖不同的软件工程场景。在这七个场景中,MindForge - 27B全部超越基础模型。在RepoZero - C2Rust任务中,完全通过率从47.00%飙升至78.00%;在DeepSWE任务中,得分从1.76%升至15.92%;在NL2Repo - Bench测试中,提供测试用例辅助时得分从61.27%提升到71.97%,不提供测试用例时从18.92%提升到23.48%。在传统代码修复任务上,MindForge - 27B也取得了一致提升,且所有提升均达到统计显著性。

从模型行为变化来看,MindForge - 27B在每个任务上的投入大幅增加,平均对话回合数从344.0增加到735.7,工具调用次数从174.4增加到373.0,消耗的token总量是基础模型的5.7倍,且工具调用量超过教师模型GLM - 5.2。同时,其每次命令失败率从10.98%下降到9.35%,说明操作更可靠。“推理后立即编辑”和“失败恢复后立即编辑”的比例几乎翻倍,与教师模型和前沿模型的差距大幅缩小。MindForge - 27B覆盖参考实现代码的比例也高于基础模型,探索更深入全面。

在工程实现方面,整个环境构建流程由三个智能体串联完成,运行在Qwen3.5 - 397B - A17B模型上,通过mini - swe - agent框架与沙箱环境交互,部署在Kubernetes集群上。模型训练使用MS - Swift框架配合Megatron后端,设置了一系列参数,如序列打包、微批大小、全局批大小等。在污染分析方面,研究团队发现训练环境和评测基准仓库重叠风险可忽略不计,因为训练任务和评测任务性质不同。

这项研究表明,用完整的开发生命周期轨迹训练模型,能让模型培养出更强、更通用的软件工程能力。虽然MindForge - 27B距离胜任复杂程序开发还有距离,但它为AI编程能力的发展提供了新方向。有兴趣的读者可通过arXiv编号2607.27146查阅完整论文,该论文还开源了相关代码、环境、轨迹以及MindForge - 27B模型权重。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version