在人工智能领域,AI agent执行任务的方式常被比作人类新员工——初入职场时缺乏经验,依赖操作手册,犯错后难以快速改进。但真正优秀的员工会总结经验,形成可复用的知识体系,为后来者提供指导。然而,当前多数AI技能进化方法存在明显缺陷:它们将“学到的知识”与“生成的技能”混为一谈,缺乏持续积累的“经验手册”,导致每次改进都需从头开始。
以EvoSkill、Trace2Skill和SkillOpt等主流方法为例,它们虽记录历史执行数据,但仅停留在流水账层面。例如,EvoSkill仅保存提案与评估结果,Trace2Skill将教训直接融入技能更新却未沉淀为长期知识,SkillOpt依赖即时反馈优化技能,均未构建独立的知识积累层。这种现象如同侦探办案后将线索锁进档案室,却未整理成“办案指南”,导致重复劳动和效率低下。
实验表明,省略维基层会导致性能大幅下降。在无维基层的情况下,技能生成模块需每次重新分析原始数据,难以形成连贯认知。例如,在数学推理任务中,省略维基层后模型准确率从63.7%降至48.7%,电子表格操作任务中从76.6%降至49.9%。这一结果验证了维基层在跨轮次知识积累中的关键作用。
WikiSkill的运转依赖四个组件的循环协作:推理agent执行任务并生成轨迹;维基维护者分析轨迹,提炼模式并更新知识库;技能提议者按需检索维基内容,生成新技能提案;门控与回滚机制验证技能效果,仅保留有效更新。值得注意的是,回滚机制仅重置技能层,维基层的失败记录仍被保留,避免重复犯错。例如,某技能因用户反馈差被撤回,但“该方向行不通”的记录会存入维基,防止未来再次提出类似方案。
在五个跨领域基准测试中,WikiSkill全面超越现有方法。测试覆盖数学推理、网页搜索、电子表格操作等任务,模型包括Qwen系列和Gemma-4-31B等。结果显示,WikiSkill在五个模型上的表现较EvoSkill、SkillOpt等提升3.3至12.0个百分点,且在几乎所有组合中超越“无技能”基线。例如,Gemini-3.5-Flash在数学推理任务中的准确率从33.0%提升至72.6%,电子表格操作从50.5%提升至76.6%。
进一步分析发现,技能进化与模型规模呈互补关系。大模型因更强的执行能力,能更好利用技能提升效果。例如,Qwen-27B模型在WikiSkill框架下平均提升23.9个百分点,电子表格任务中甚至提升40.9个百分点。但小模型结合优质技能也可逆袭大模型:Qwen-9B配WikiSkill技能后准确率达47.4%,超越无技能的Qwen-27B(39.4%)。这表明,经验手册可弥补模型规模差距,正如实习生凭前辈总结的“捷径”超越盲目摸索的资深员工。
更令人意外的是,技能迁移常带来超预期效果。例如,Qwen-27B生成的技能用于Qwen-9B时,电子表格任务准确率达50.5%,超越小模型自身进化的33.6%;Gemma-4-31B使用Qwen-27B技能后,数学推理准确率从33.9%跃升至73.7%。但迁移并非总有效:Qwen-4B技能用于Gemini-3.5-Flash时,电子表格任务准确率从50.5%暴跌至18.1%。原因在于小模型技能常包含针对自身局限的“补丁”,对强模型反成束缚。
以ALFWorld任务为例,Qwen-27B的技能进化过程清晰展示了维基层的作用。初期,维基维护者发现“拿起-检查-放回循环”的无效行为,技能提议者据此提出“目标导向行动”技能,但因缺乏具体规则被拒。审计日志保留拒绝原因后,第二轮提出“打破重复循环”技能,明确“不放回原位”规则,最终通过验证。后续迭代中,维基又记录“多操作循环”等新模式,技能逐步细化为“每种操作对每件物品仅做一次”。这一过程依赖维基的连贯记录,避免重复摸索。
数据统计进一步验证了持续知识积累的价值。Qwen系列模型生成的技能文档较长(平均118.9至128.6行),而Gemma-4-31B和Gemini-3.5-Flash更简洁(45.1行和81.2行)。电子表格任务因错误类型复杂,生成的技能最长(142.5行),维基模式最多(9.8条)。技能改进并非一蹴而就:早期接受量仅占39%至52%,中期和晚期仍持续优化,尤其在网页搜索任务中,晚期改动占比达28%,表明长期知识积累支撑了更精细的技能打磨。









