ITBear旗下自媒体矩阵:

SAP实验室创新TRACE方案:破解企业AI“找错工具”难题,实现高效精准检索

   时间:2026-08-07 05:54:11 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

企业级AI助手在面对海量工具时,常因工具描述高度相似而出现检索错误,这一问题正困扰着众多企业。SAP实验室研究人员针对这一痛点,开发出一套名为TRACE的训练方案,旨在提升AI助手在复杂工具库中精准检索工具的能力。

企业级AI助手与日常使用的手机App不同,它需要处理超过八千个功能各异的内部工具接口,其中许多工具的名字和描述几乎一致,导致检索困难。SAP研究团队分析609个真实用户会话后发现,约82%的工具检索失败发生在这些相似工具之间。这些工具需依赖企业内部业务规则区分,如某个API的新旧版本描述几乎无异,普通语义匹配难以分辨。

当前主流的嵌入式检索方案,将工具描述和用户问题转化为数学向量,通过计算向量距离检索工具。但在企业场景中,这种方法召回率仅约27%,且无法真正理解工具含义,仅做表面相似度比较。另一种思路来自ToolGen研究,让大语言模型直接记忆工具,分配虚拟令牌进行检索。该方法在公开数据集上召回率超90%,但会覆盖模型对工具含义的理解,导致“知识-检索解耦”现象。

TRACE训练方案分两阶段进行。第一阶段采用“多格式记忆”方案,通过三种练习方式强化模型记忆:根据工具描述说出虚拟暗号、根据暗号反推工具描述、从多个相似工具暗号中选出正确答案。这一阶段使用LoRA“轻量微调”方式,保留模型原有知识。第二阶段是TRACE的创新所在,训练模型在给出工具答案前生成“思考轨迹”,引导模型做出正确判断。

生成的样本需经过严格质量检查,包括答案工具来自候选池、问题不直接出现工具名字、答案格式规范、规则类样本推理过程引用规则内容等。不合格样本经AI评审员打分后重新生成,重试五次不行则丢弃。

在推理方式上,TRACE采用“单束贪心解码”,模型从左到右逐字输出,先输出推理思考内容,再输出JSON格式的工具令牌列表。这种方法依赖模型通过两阶段训练内化的工具知识和推理能力,实测无效工具暗号比例仅3%。与ToolGen的约束束搜索方法相比,TRACE推理速度大幅提升,同一台GPU服务器上,单个用户问题处理时间从约19秒缩短至约1.9秒,32个用户并发时每秒处理请求数从0.05个提升至11.2个。

研究团队在包含8283个工具的企业级目录上进行测试,工具来自HR和财务两个业务领域。知识保留测试显示,非推理式检索训练使模型多选题测试准确率跌至接近随机猜测水平,而推理式训练不仅恢复准确率,甚至比不做第二阶段训练时更高。在454道专业多选题上,不做检索训练时基础准确率为69.2%,非推理检索训练后跌至33.7%,TRACE推理检索训练达61.5%,加上业务规则训练后为56.4%。

检索性能方面,TRACE与基线方法对比优势明显。纯嵌入式检索在HR领域top-10召回率为27.5%,财务领域为52.7%;TRACE在不使用约束搜索、仅用单束贪心解码的情况下,HR领域召回率达85.5%,财务领域为60.2%。财务领域召回率偏低因规则覆盖不足,研究团队通过消融实验验证,增加规则数据对财务领域有提升作用。

研究团队还测试了规则数据量对性能的影响。对于HR领域,随着规则样本数量增加,检索召回率提升超30个百分点,专家多选题准确率仅损失不到4个百分点,且下降主要体现在通用领域知识上。分析模型推理轨迹发现,规则训练后71%的推理轨迹引用业务规则,引用规则的推理轨迹检索正确率达94.6%。

研究团队测试了三种令牌格式对训练效果的影响。扁平格式、裸层级格式和包裹层级格式在非推理训练下均出现知识崩塌现象,推理训练可有效恢复知识。包裹层级格式在不做检索训练时基础知识准确率最高,因此论文主体选用该格式展示主要结果。裸层级格式表现相对较弱,各项指标落后约10个百分点。“亡羊补牢”式训练效果因格式而异,对于结构复杂的令牌格式,非推理检索训练造成的损伤几乎不可逆。

TRACE方案为解决企业AI助手工具检索问题提供了新思路,通过让模型养成“边推理边检索”的习惯,并利用企业内部业务规则,降低工具检索错误率。目前,该方案已在HR和财务两个领域验证,更大模型或其他行业领域的应用效果有待进一步探索。财务领域召回率提升空间较大,研究者指出每条规则需约6个训练样本才能显现效果,且目前业务规则依赖领域专家手工撰写,自动化提取规则的可行性尚未验证。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version