当你走进一家餐厅,服务员递上菜单,你只需在清晰的选项中挑选心仪的菜品。然而,当餐厅取消菜单,要求你用语言描述需求时,服务员可能反复端上不尽如人意的菜肴——这种令人无奈的场景,正映射出当前主流AI搜索系统面临的困境。国防科技大学研究团队提出了一种名为“Harness-G”的新型框架,通过重构AI的“点菜方式”,为这一难题提供了突破性解决方案。
传统AI搜索系统以Search-R1为代表,其工作流程类似“自由描述”:面对问题时,AI生成关键词进行检索,若信息不足则更换关键词继续搜索,直至形成答案。但研究团队发现,随着训练推进,AI虽不断调整关键词表述,实际获取的内容却高度重叠。例如,输入“辣的鱼”与“麻辣鱼类菜肴”可能指向同一结果,导致看似活跃的搜索行为实质陷入“检索等价性崩塌”——训练后期,不同路径产生有效结果的概率从初期的86%骤降至不足10%。这种“假性努力”使群体相对策略优化(GRPO)等训练方法失效,因比较不同路径的前提是结果差异,而单调的搜索路径让学习信号完全消失。
Harness-G的核心创新在于将“自由描述”转化为“菜单选择”。研究团队首先构建了一个程序化的知识图谱,将知识库拆解为段落、句子、实体三类单元,并明确它们之间的关联。例如,句子属于哪个段落、提及哪些实体、实体间如何关联等。这一过程依赖句子拆分、命名实体识别和向量化编码等技术,完全无需调用大型语言模型,构建成本极低——处理千词元仅需0.12秒且零费用,而同类系统如Graph-R1需花费约2.81美元,LightRAG等则高达4美元以上。
基于知识图谱,Harness-G设计了动态菜单系统。当AI需要检索时,系统提供三类明确选项:选择(标记当前句子为证据)、查找(围绕选定实体扩展信息)、回答(生成最终答案),并支持组合动作“Answer_With”以一步完成证据收集与回答。这种设计将搜索动作限制在已知选项池内,确保不同AI实例面对同一问题时,选择不同实体即产生真正不同的检索路径,从而维持训练所需的多样性。实验数据显示,自由关键词搜索系统的“检索等价类数量”迅速从平均2个降至1个,而Harness-G始终稳定在1.5至2.5个之间。
为解决多步骤决策中“早期铺垫步骤被忽视”的问题,Harness-G引入了“结构化非近视信用”(SNC)奖励机制。该机制包含两部分:一是“前沿相对优势”,通过比较同一状态下不同选项的潜在收益分配奖励,确保奖励公平且仅给予真正优化的选择;二是“溯源激活信用”,记录证据间的依赖关系,将下游动作的高分沿链条反向传播至早期铺垫步骤。例如,侦探破案中,找到目击者的关键行动虽不直接破案,但会通过“锁定嫌疑人→获取供词”的链条分享荣誉。这一机制使早期步骤获得复合奖励,鼓励AI进行多步推理。
在六个标准问答数据集的测试中,Harness-G展现了显著优势。在多跳问答(需跨多篇文章推理)中,1.5B参数版本的平均F1分数比Graph-R1高出10.74个百分点,3B参数版本高出3.98个百分点;在单跳问答中,性能同样领先。尤其在多跳场景下,3B版本在2WikiMultiHopQA、HotpotQA、MuSiQue上的F1分数分别超出Graph-R1约8、9、6个百分点。与基于GPT-4o-mini的图谱系统横向对比时,Harness-G在零构建成本下全面超越对手,凸显其实用价值。
训练稳定性方面,Harness-G的F1分数持续上升,未出现主流系统的“奖励崩塌”现象,梯度范数始终低于9,表明参数更新平稳。尽管训练后期对话轮次(约3.6轮)多于Search-R1(2.3轮)和Graph-R1(2.8轮),但每轮生成的词元数(约2500个)显著少于后两者(分别4300个和3100个),说明其步骤更精准、信息密度更高。
泛化能力测试中,Harness-G在30对“训练集→测试集”组合中赢得21对,跨数据集F1分数从Graph-R1的44.10提升至47.38,多跳场景增益达6.45个百分点。在医学、农业等完全陌生领域的零样本测试中,其平均F1分数达42.30,超过Graph-R1(39.14)和HyperGraphRAG(38.61)。由于知识图谱构建无需标注数据或额外模型调用,扩展至新领域的边际成本极低。
消融实验进一步验证了设计有效性。仅替换为菜单式选择,多跳数据集F1分数即提升超17个百分点(MuSiQue上超35个点);叠加SNC机制后,分数再提升2至4个百分点。拆分实验表明,“前沿相对优势”与“溯源激活信用”缺一不可。Harness-G在GRPO、PPO等四种训练算法及Qwen2.5-3B、Llama-3.2-3B等三种底层模型上均表现稳定,证明其通用性。
目前,Harness-G为纯文本系统,研究团队正探索将其结构化导航思路延伸至多模态场景。完整论文及开源代码已发布于arXiv平台(编号2607.27652),供研究人员复现与扩展。











