当你在搜索引擎输入“北京最好吃的火锅”,系统如何在数亿网页中快速筛选出最相关的结果?这一过程背后涉及两种截然不同的信息检索技术——稀疏检索与稠密检索。传统方案往往只能依赖单一技术,或需搭建两套独立系统并行运行。近日,一项由多国科研机构联合完成的研究提出名为UEmbed的统一嵌入模型,首次将两种检索方式整合至同一架构,并突破性实现了对文本、图像、视频等多模态内容的同步处理。
稀疏检索类似图书馆的索引卡片系统,通过关键词匹配快速定位内容,但无法理解“汽车”与“轿车”的语义关联;稠密检索则像博学的管理员,能捕捉语义相似性,却存在计算效率低、缺乏可解释性等问题。UEmbed的创新在于将这两种能力“合二为一”:模型既能像索引卡片般快速筛选,又能像语义专家般深度理解,且无需重复处理同一份数据。研究团队通过分切词汇表的设计,将20万词汇划分为16个语义子集,每个子集由专属“虚拟助理”负责评分,既解决了单向语言模型的信息瓶颈,又保留了自回归架构的部署优势。
训练该模型需跨越三大技术门槛。首先是架构兼容性,传统稀疏检索依赖双向注意力机制,而现代大语言模型普遍采用单向架构。研究团队通过在输入序列末尾添加16个特殊令牌,使每个令牌能“看到”完整内容,从而绕开单向模型的限制。其次是多模态数据处理,团队混合了文本、图像、视频等394万条样本,并采用教师模型生成“困难负样本”以提升区分能力。最后是训练稳定性,通过混入文本数据加速收敛,并解耦稀疏与稠密检索的温度参数,最终在16至32张A100 GPU上完成2B至9B参数规模的模型训练。
在性能测试中,UEmbed展现出显著优势。在涵盖78个子数据集的MMEB-v2评测平台上,其9B版本稠密检索得分71.8,稀疏检索得分71.0,两者差距不足1分,远超同类模型。特别是在视觉文档检索任务中,稀疏模型与稠密模型性能几乎持平,验证了其对结构化内容的天然适配性。在文本检索领域主流基准BEIR上,UEmbed稠密检索均值达56.3分,稀疏检索与专用模型Echo-Mistral-SPLADE持平,而后者仅支持单一检索方式。
实际应用场景中,UEmbed的混合评分模式通过线性加权稠密与稀疏结果,在文本和视觉文档检索中分别提升0.3分和0.5分。部署效率测试显示,通过调整激活词数量,检索延迟可从100毫秒降至20毫秒,为工程师提供灵活的性能权衡空间。在智能体搜索场景中,稀疏检索模式使大语言模型平均搜索轮次减少8%,显著降低API调用成本。研究团队通过消融实验证实,联合训练未导致模式间相互干扰,且语义聚类的词汇分区策略优于随机分配。
尽管取得突破,该研究仍存在局限性。训练数据以中英文为主,导致多语言检索泛化能力不足;词汇表中残留的非标准子词影响稀疏表示可解释性;视频任务因信息密度过高,稀疏模型表现弱于稠密模型。研究人员指出,这些问题需通过扩充多语言数据、优化词汇剪枝机制及改进视频表征方法解决。目前,完整技术细节已通过论文编号2608.02583在arXiv平台公开,为信息检索领域提供新的架构思路。










