让智能体干完一件事并不难,难的是让它“越干越好”。长期以来,办公智能体普遍为“交付即定型”:一旦任务失败或未达预期,需要人工复盘日志、修改提示词、补充工具后再重新测试,调优成本高、周期长,有效经验也难以积累。
近日,由华为 2012 实验室、华为云、终端、计算等团队联合构建的开源 AI Agent 平台openJiuwen首发双维度RSI框架(Recursive Self-Improvement,递归自我改进),在WorkSwarm蜂群办公智能体完整落地,率先支持“可插拔的Harness+Artifacts”双维度优化,用户只需像布置普通任务一样发起“实验”,就能全程观看智能体如何一步步进化升级。

该成果为AI Agent自身迭代改进提供了工程化的答案,在真实办公场景中实现“从失败中学习、在任务中成长”。目前,RSI 实验模式已在WorkSwarm上线。
办公智能体有了“错题本”
早在今年6月,openJiuwen就发布了业界首个Auto Harness能力,让Harness在实战中自动学习、自动优化,提供了一套评测驱动的、覆盖Harness全栈组件的端到端自动优化框架。而RSI框架则进一步让智能体从真实任务反馈中生成改进方案、执行验证、保留有效改进,帮助智能体持续优化。这意味着对于横跨文档、代码、数据和工具的办公任务,工作方法可以改进,交付物可以持续打磨,成功与失败的经验也能为后续任务所用。
据介绍,openJiuwen RSI的核心是一套让不同自我迭代任务都能稳定运行的工程框架,以版本化优化对象、可验证的执行证据和可扩展的算法为核心,通过四层协作,把任务目标转化为可执行、可评估的改进过程。

通俗地说,RSI就像一个团队,任务层决定“优化什么、如何评价、能用多少资源”,迭代优化层决定“下一步试什么、哪些改进可以采纳”;执行层负责“尝试优化并检测结果”;基础框架层提供运行、模型与上下文、沙箱隔离、状态恢复和可观测性等统一能力。
目前,RSI框架已融入WorkSwarm新增的“实验”模式,用户可以像创建普通任务一样发起Harness优化或产物优化,查看每一轮的改进过程和搜索路径,最终拿到经过验证的最优结果。
三大场景优化表现优异
根据开发者实战检验,RSI加成的WorkSwarm“实验”模式对于需要反复试错、不断优化的场景非常贴合。
例如在Harness优化方面,当出现失败案例,用户仅需四步即可完成“改错”:一、准备包含用例知识、任务要求、评测方式、参考答案和评分规则的JSON评测集;二、进入 WorkSwarm的“实验”页面选择“Harness优化”,选择优化模型、测试模型和初始插件,再选择评测集、评测方式和最大迭代轮次;三、执行自动迭代,页面持续展示得分、迭代轮次、模型用量和搜索树,试错和采纳过程一目了然;四、实验产出有效版本后,点击“安装插件”,最优Harness即作为插件包导入并热加载。

基于权威测试集SWE-bench Lite,该模式使Harness优化通过率由61.0%提升至 87.0%,同时冻结优化后的Harness在Evo-Bench General 64 道独立评测题上的单次执行通过率也由 60.9%提升至71.9%,表现极其优异。
而在科研论文产物优化方面,WorkSwarm既可以从科研构想出发生成科研论文,也可以提交已有论文继续优化。用户只需要选择目标论文,填写优化指令(研究主题、目标问题或重点改进方向),设置最大迭代轮次,即可创建实验。过程中可在详情页看到当前分数、最优论文、模型用量和迭代轮次,记录了每一轮的改动细节、评测结果以及未被采用的原因。实验完成后支持预览,确认后一键下载完整论文。

在算法程序产物优化方面流程也较为类似,支持从现有实现出发自动尝试多个版本。用户准备好待优化的初始科研算法程序、评价配置和任务包,依次选择“产物优化”和“程序”,即可创建与启动优化。过程中可在详情页看到当前最优分数、模型用量和程序优化树,每个节点可查看改动、评测结果和失败原因,实验完成后,一键下载经过多轮尝试和评测筛选的最优程序,用于后续验证、集成或开发。

以算力亲和降低多轮优化成本
多轮优化的实质是多轮生成候选、执行任务、评测结果,背后是对提示词、工具描述和任务材料的反复使用,也意味着优化规模越大,等待和资源开销就越惊人。成本问题会否让开发者对RSI框架望而却步?
openJiuwen给出的答案是“算力亲和”:依托国产昇腾算力基础设施,让计算引擎“读懂”智能体的工作状态,通过上下文缓存调度等技术,降低多轮优化的时延与资源消耗,让智能体在持续改进的同时更高效地使用算力。
实际测试显示,开启“算力亲和”后,智能体的响应速度提升近16%,最慢场景下提升超过19%,命中率由7.53%提升至14.36%,关键存储资源消耗下降两到三成。持续学习与降本增效,在同一个框架里实现了兼得。

至此,openJiuwen RSI已经形成一条从创建实验到获得优化结果的完整链路:Harness优化根据失败案例改进智能体的工作方式——Artifacts优化打磨科研论文和算法程序等交付产物——再结合算力亲和,减少重复计算,降低资源开销。这一突破为智能体持续进化、适应更复杂的场景任务铺平了道路。
openJiuwen方面透露,后续框架将继续丰富搜索、评测与融合算法,增强跨任务经验复用,并沿统一架构接入模型优化与混合优化,让Harness、Artifacts和Models在明确的评价标准、预算与安全边界内协同迭代。华为云AgentArts将openJiuwen引入到商业化平台能力中,提供开箱即用的体验,感兴趣的朋友可锁定华为全联接大会2026,现场体验。openJiuwen官方也提供了在线体验入口,Token免费。











