在人工智能领域,一项来自英伟达研究团队的新成果正引发广泛关注。该团队成功开发出一种技术,能够让不同模型间迁移KV缓存,这一突破有望显著提升大语言模型(LLM)的运行效率,降低使用成本。
KV缓存是大语言模型运行中的关键机制。以常见的对话模型为例,当用户输入一段文字后,模型在生成第一个回复词之前,需要先对整个输入上下文进行全面处理,并将处理过程中产生的中间结果存储为KV缓存。后续生成每个词时,模型都可以直接复用这些缓存,因此回复速度会大幅提升。这也是为什么在使用ChatGPT或Claude等模型时,第一个词的生成明显较慢,而后续内容能快速输出的原因。
然而,传统的KV缓存存在一个明显局限——它具有“模型专属”特性。这意味着,如果用户切换到另一个模型,或者对现有模型进行版本升级,之前计算好的KV缓存将无法继续使用,新模型必须重新处理整个上下文。在处理长文本时,这种重复计算不仅耗费大量时间,还会造成计算资源的浪费。
英伟达研究团队提出的方案有效解决了这一问题。通过特定的转换技术,一个模型计算出的KV缓存可以被另一个模型直接使用。目标模型无需再经历预填充阶段,可直接利用转换后的缓存进行后续生成任务。据测试,这种转换过程的速度比重新处理上下文快2.7至25倍,具体提升幅度取决于模型和上下文的复杂程度。
这一突破对AI行业的影响不容小觑。目前,LLM API的使用成本中,上下文处理占据了相当比例,尤其是在长对话和长文档处理场景下。如果KV缓存能够在不同模型间迁移,用户在切换模型时将无需承担重复计算的成本,模型升级时也能保留已有的对话上下文。这不仅提升了用户体验,还可能推动AI推理基础设施的设计变革,使模型切换更加高效和经济。











