当我们将一本百科全书的知识从一个人脑中取出,再植入另一个完全不同的人脑中,后者能否理解其中的内容?这一看似科幻的设想,如今正被大语言模型领域的研究者们付诸实践。传统上,大模型获取知识主要有两种方式:检索增强(RAG)和参数化方法。前者通过外部资料库实时检索信息,虽能随时更新知识,但检索耗时且检索内容与模型自身思考方式衔接不畅;后者将知识直接融入模型参数,推理速度快,但知识难以修改、核实或迁移。
针对这些局限,一项名为Engram的新技术提出了折中方案:既像检索增强一样将知识存储在外部以便修改,又能像参数化方法一样快速使用。Engram是一种为Transformer模型设计的外部条件记忆机制,通过确定性哈希检索预先存储的n-gram向量,再由小型学习模块将这些向量注入模型隐藏状态。其核心在于“寻址-存储-读取”的解耦设计:寻址通过哈希函数机械计算地址,无需理解语义;存储是提前训练好的向量表;读取则由小型神经网络模块将外部向量映射到模型隐藏空间。这种设计理论上使记忆表迁移成为可能——只要新模型能计算出与旧模型相同的地址,就能读取同一批内容。
为验证这一设想,研究者设计了“跨模型冻结记忆迁移”实验:先用一个模型训练记忆表并冻结其内容,再将其接入另一个模型,仅训练轻量级读取模块。实验覆盖Pythia、Qwen3.5、TinyLlama三个不同架构和分词器的模型家族,九种组合全部实现困惑度下降,降幅从1.6%至15.7%不等。其中,Qwen3.5-0.8B训练的记忆表迁移到TinyLlama-1.1B时效果最显著,困惑度下降15.7%,且两个模型架构和分词器均不同。
一个反直觉的发现是,记忆迁移效果与模型内部表示相似度无关。研究者通过CKA指标分析发现,内部表示相似度最低的Pythia-160M与TinyLlama-1.1B组合迁移增益最大(10.6%),而相似度最高的Pythia-160M与Pythia-410M组合增益仅1.6%。这表明,迁移成败的关键在于读取模块能否有效翻译记忆内容,而非记忆表本身或模型相似度。
进一步实验验证了读取模块的重要性。研究者设计了不同复杂度的读取器:单层单分支版本仅轻微提升效果(平均准确率33.5),而双层四分支版本将准确率提升至38.5。层数增加带来的提升(3.3分)大于分支数量增加(1分),表明多层次注入能更充分激活记忆价值。对照组实验显示,参数匹配的前馈网络模块效果远低于记忆读取器(34.5 vs 38.5),且困惑度更低但下游任务表现更差,说明低困惑度不等于强任务能力。
记忆迁移的效果具有任务选择性。在常识判断(RTE)、科学问答(SciQ)等依赖事实性关联的任务中,所有规模模型均获提升;但在考察审慎判断的TruthfulQA任务中,所有规模模型表现均下降。进一步分析发现,记忆通过为模型推理提供事实支持间接提升答案质量,而非“抄答案”。例如,在自然问答任务中,迁移记忆使模型对正确答案的对数概率显著提高,但屏蔽记忆通道对结果影响微小,说明记忆的作用是潜移默化的辅助。
从成本角度看,记忆迁移能大幅降低训练时间和数据需求。在Pythia-160M迁移到Pythia-410M的实验中,迁移方案仅需500万训练token即可达到21.8的困惑度,而从零训练需5000万token才能追平;迁移方案的可训练参数仅105万,仅为从零训练的3%。更大规模的Qwen3.5-0.8B迁移到Qwen3.5-2B实验中,迁移方案在所有训练预算下困惑度均低于从零训练,且BoolQ、RTE、SciQ任务分别提升1.5、2.5和0.8个百分点。
实际部署时,记忆资产复用有两种路径:直接复用提供方的读取模块(需模型接口兼容),或针对自身模型训练专属读取模块。实验数据显示,直接复用可使问答分数从32.1提升至38.3,自定义读取器可进一步提升至38.5。成本估算表明,当记忆资产被复用约9至11次时,迁移方案的总成本将低于从零训练,凸显其经济价值。
为排除干扰因素,研究者进行了多项控制实验:参数量匹配的前馈网络对照证明单纯堆参数无效;地址打乱实验显示准确率从38.5骤降至32.5,强调地址与内容对应关系的重要性;随机记忆表对照表明困惑度低不等于任务表现好。针对中文、日文等无空格分词语言,研究者改用字符级哈希方案,在中文维基百科上实现2.251%的困惑度提升,日文上提升1.023%,证明框架的跨语言适用性。
尽管实验规模已达90亿参数,但研究者指出,读取器容量与模型规模的匹配关系、极端混合语言场景下的地址方案、更复杂的读取器设计等方向仍需探索。例如,当前按词边界寻址的方案在代码文本或字节级分词器中可能失效,需开发更强健的地址映射方法;读取器的设计空间也远未穷尽,非线性变换或自适应分支聚合等方案可能进一步优化效果。











