当一家大型企业积累了几十万份内部文件,包括员工聊天记录、项目工单、邮件、会议纪要和代码审查记录时,如何搭建一个能通过自然语言查询自动检索答案的“智能助手”?面对市面上众多方案,从传统关键词搜索到AI向量搜索,再到知识图谱和自主探索的Agent,哪种方法最有效?一项由多所机构联合开展的研究给出了出人意料的答案。
研究团队没有沿用以往在固定文档库上比较不同方法的常规做法,而是设计了一个覆盖28个文档规模的“阶梯式”实验,从1144份基础文档逐步扩展到51万余份完整文档,总词汇量达6亿。这种设计模拟了企业文档库从初创到成熟的增长过程,重点观察不同方法在文档规模变化时的表现差异。
实验发现,诞生于上世纪80年代的BM25关键词搜索算法在文档量超过10万份后,其准确率开始超越所有其他方法,最终在完整文档库上保持50.5分的成绩,领先第二名近20分。这个结果颠覆了“新技术必然优于旧方法”的普遍认知。研究团队将其归因于企业文档中大量存在的专有名词——项目代码、产品版本号、人名等精确信息,BM25的词汇匹配机制能准确识别这些关键字段,而语义搜索方法则容易受到相似但错误内容的干扰。
被寄予厚望的Agent方法在小型文档库上表现优异,与BM25不相上下,但随着文档量增加,其准确率急剧下降。在完整文档库测试中,Agent的得分降至30.7分,仅相当于BM25的60%。问题出在Agent的搜索方式:它像侦探一样逐步翻找文件,当文档数量从几千份激增到几十万份时,这种局部探索策略的效率呈指数级下降,经常在预算耗尽前无法找到正确路径。
知识图谱类方法面临更严峻的挑战。MS-GraphRAG在文档量达到8750份时就因资源耗尽无法继续,LightRAG在2826份文档时即告失败,其建库成本随文档量增长呈超线性上升趋势。即便表现最好的HippoRAG 2,在完成最大规模测试时的准确率也比同规模下的BM25低15分。研究指出,图谱方法在抽取实体时会产生大量噪音,且难以区分语义相近但事实错误的内容,这些缺陷在文档规模扩大后被显著放大。
实验中一个引人注目的发现是“Agent+BM25”混合方案的表现。这个方案保持Agent的推理能力,但将其搜索工具替换为BM25关键词搜索。在完整文档库测试中,混合方案取得69.4分,比纯BM25高出14.6分,同时计算消耗仅为纯Agent方案的九分之一。这表明Agent的推理价值需要建立在准确检索基础之上,单独使用反而会因搜索效率低下而拖累整体表现。
当按问题类型拆分分析时,不同方法的优劣更加明显。在基础信息查找和事实确认类问题上,BM25占据绝对优势;而在需要综合多文档信息、识别矛盾或判断完整性的复杂问题上,Agent的推理能力则显现出独特价值。这种差异为混合架构的设计提供了理论依据:用BM25处理简单查询,在需要深度理解时调用Agent进行二次处理。
成本分析进一步巩固了BM25的优势地位。在整个测试过程中,BM25始终位于“准确率-总成本”效率前沿,即在相同成本下没有其他方法能达到更高准确率,在相同准确率下也没有更经济的方案。其建库成本几乎为零,查询消耗不随文档量增长而显著增加,这些特性使其成为大规模企业文档检索的默认选择。
研究团队特别指出,现有评测方法存在系统性盲点。多数研究仅在固定规模文档库上进行测试,这种做法可能得出误导性结论。例如,在最小规模测试中领先的Agent方法,随着文档量增加会迅速失去优势;而图谱方法在小规模上的表现也远优于其在大规模场景下的实际能力。因此,跨范式评测必须同时报告多个规模下的性能数据。
这项研究对正在构建企业知识检索系统的团队具有直接指导意义。研究建议从BM25开始构建基础检索能力,其近乎零的建库成本和可预期的查询消耗是显著优势;对于需要处理复杂查询的业务场景,可以在BM25检索结果基础上叠加Agent的推理能力;在文档量未达到百万级之前,知识图谱方法的高建库成本难以通过准确率提升来弥补。完整实验数据和代码已随论文公开,供研究人员进一步验证和扩展。











