ITBear旗下自媒体矩阵:

清华团队发布开源代码模型VeriLoop Coder-E1:循证螺旋赋能递归自我改进新路径

   时间:2026-08-03 02:16:05 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

清华大学深圳国际研究生院智能机器人实验室团队近日发布了一款名为VeriLoop Coder-E1的开源代码模型,该模型基于Qwen3.6-27B架构,专注于仓库级代码修复和智能体式软件工程任务。在Hugging Face平台的四项软件工程基准测试中,该模型表现出色,分别在SWE-bench Verified、SWE-bench Pro、Terminal-Bench 2.0和DeepSWE中取得了85.20、62.38、76.40和33.63的成绩。

在32B及以下开源模型的比较范围内,VeriLoop Coder-E1在前三项测试中排名第一,在DeepSWE中排名第二。在所有开源模型的竞争中,该模型分别位列第二、第一、第一和第五。这些成绩表明,VeriLoop Coder-E1在代码修复和软件工程任务处理方面具有显著优势。

VeriLoop Coder-E1的核心技术在于窄域参数高效微调(PEFT)与Self-Harness机制的协同作用。在保持Qwen3.6-27B基座模型不变的前提下,研究团队通过少量可训练参数增强了模型在真实软件工程任务中的专业能力。这些能力包括工具契约遵循、证据-结论绑定、不确定性识别、验证失败解释、局部修复与回滚边界控制。微调权重通过可拆卸的Surface Host Adapter外挂加载,不改变原始基座权重。

Self-Harness机制则将这些专业能力组织为多轮执行链,每轮执行都有明确的任务分工。首轮根据问题描述、仓库上下文、接口约束和验收条件生成候选代码,后续轮次则将已生成代码、测试错误、工具回执等信息重新编译为结构化Markdown工作包。这种设计使模型能够在继承已确认结果的基础上,针对被证据否定的局部问题进行分析和修复,而不是简单重复相同提示。

研究团队提出的循证螺旋(Evidence-Governed Spiral)概念是该模型的重要创新。这一机制要求每一轮生成都必须接受反证、探索、修订与复验,只有通过验证的纠正才能进入下一轮并影响后续方法选择。循证螺旋遵循"证-伪-探-修-验-化"的逻辑链条,使系统不仅能够修正当前结果,还能让经验证的纠正改变未来发现问题、界定证据、发起探查和实施修复的方式。

在具体实现上,"证"阶段负责收集和筛选能够实质改变当前判断的代码、接口、测试等信息;"伪"阶段主动检验候选方案的前提和正确性;"探"阶段围绕已暴露的问题缺口进行针对性检索;"修"阶段将错误结果转化为边界明确的修复条件;"验"阶段要求修订后的产物重新接受检验;"化"阶段则将通过验证的结果压缩为下一轮可调用的证据状态和方法约束。

VeriLoop Coder-E1的开源策略体现了研究团队的开放态度。团队依据Apache 2.0许可证开放了模型权重、Tokenizer、配置文件、部分软件工程窄域PEFT适配器及评测材料。开发者可以在许可证范围内下载、部署和修改模型,进行二次研究与应用开发。然而,Self-Harness的完整实现暂未开放,因为它是复杂的运行时控制平面,负责将软件工程任务编译为多轮、分阶段且相互约束的模型调用。

该模型发布后迅速获得了国际开源社区的关注。在Hugging Face平台开源不足48小时,就有巴西等地的开发者主动制作并发布了GGUF低精度量化版本。这些量化版本使模型能够在更低显存和内存的个人设备上运行,通过llama.cpp、Ollama、LM Studio等本地推理工具部署,并可进一步开发为本地OpenAI兼容接口。数据显示,模型原始仓库单日下载量达到413次,第三方GGUF量化仓库单日下载量达到955次。

研究团队下一步计划将研发重心转向通用Code Agent的开发。与单纯扩展基础模型能力的路径不同,他们认为真正的智能在于系统能否形成可修正的状态表征,预测行动后果,在不确定条件下规划与执行,并在现实推翻预测时改变未来行为。软件工程被视为检验这一观点的理想领域,因为代码仓库提供环境状态,修改和工具调用构成真实行动,编译、测试等结果给出客观外部证据。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version