人工智能如何“记住”信息?传统观点认为,AI像人类一样,将原始信息逐字存储,需要时直接调用。然而,最新研究显示,AI的记忆机制远比这复杂——即使原始信息被彻底删除,某些情况下它仍能通过“计算痕迹”还原关键内容。这种现象被命名为“语义物化”,即信息在模型处理过程中被“烙印”到后续计算节点中,形成独立于原始文本的隐性记忆。
研究团队通过对比实验验证了这一现象。他们构造了包含“源事件”和“根事件”的历史记录,例如“S寄存器状态为在线”是源事件,“M镜像S的状态”是根事件。在模型完整阅读历史后,研究者删除源事件的缓存记录,仅保留根事件的缓存行,随后提问:“M的状态是什么?”结果显示,模型能准确回答“在线”,尽管提问文本中从未直接提及“在线”这一信息。为排除偶然性,研究者设计了“孪生”历史版本,将源事件改为“S离线”,其他内容完全一致。在99组对比实验中,模型对第一个版本的回答与源事件一致的比例高达99%,反向回答的比例为0,统计学上的巧合概率趋近于零。
这一现象并非模型偶然行为。研究者在Qwen3-8B、Ministral-3-8B和Gemma-4-12B等多个模型上重复实验,均观察到类似结果。例如,在Qwen3-8B的256组复制实验中,130组回答与被删除的源事件一致,仅125组因问题本身与源事件无关而给出相同答案。这表明,模型在阅读历史时,会将早期信息“预消化”到后续缓存行中,即使原始记录被销毁,信息仍以计算痕迹的形式存在,并能在需要时指导模型给出正确答案。
进一步研究发现,这种“隐形传递”存在明显边界。研究者将信息按复杂程度分类测试:二元状态(如“在线/离线”)的传递准确率高达93.4%,四选一状态的准确率骤降至22.3%,八选一状态仅为15.6%,而具体数值(如三位数字)的传递准确率为0。需要推理的结论(如“传感器读数超阈值应触发警报”)也无法通过缓存行传递。研究者将此现象概括为“紧凑状态信封”——只有粗粒度的状态信号能被封装并传递,复杂信息或需要推理的内容则超出信封容量。
触发语义物化的条件同样值得关注。研究者设计了16种不同措辞的“根事件”,包括“M跟随S”“M与S同步”等镜像表达,以及“标志与结果一致”“标志据结果赋值”等标志表达。测试发现,措辞的微小差异会导致信息写入率大幅波动。例如,“M跟随S”的写入率为83%,而语义几乎相同的“M与S同步”仅为45%;“标志与结果一致”的写入率高达94%,而“标志据结果赋值”仅为48%。更反直觉的是,所有措辞的理解准确率均接近100%,表明模型完全理解语义,但写入缓存行的能力却因措辞而异。不同模型对措辞的敏感性也存在差异——Qwen3-8B对“镜像”类措辞更敏感,而Gemma-4-12B的写入率普遍较低,最高不超过75%。
信息在缓存行中的“落点”同样有规律。研究者构造了“S→M→T”的传话链,发现仅保留M的缓存行时,模型能准确回答M和T的状态;但仅保留T的缓存行时,模型几乎无法回答任何问题。这表明,根事件(如M)是信息“落地”的关键节点,而边缘事件(如T)仅作为路由路径存在,本身不存储信息。若删除根事件,边缘事件的缓存行将失去价值。
基于这一发现,研究者探索了主动利用语义物化的可能性。他们设计了五种级别的“载体事件”,从弱到强依次为:被动提及(如自然语言中随口提到某个值)、有依据的绑定(明确说明两个值的关联)、结构化指令、自然语言计算指令(如“请推断并记录结果”)和显式文字记录(直接写出答案)。实验显示,被动提及的跟随率仅为6%,自然语言计算指令可提升至51%,而显式文字记录的跟随率达100%。这意味着,通过刻意设计载体事件,可将信息传递效率提高8倍以上。然而,研究者也指出,自然语言计算指令的可靠性仍不足一半,因此语义物化更适合作为辅助机制,而非替代明确文字记录的主要方案。
在真实对话场景中,自然提及的效果远不如刻意设计的载体事件。研究者使用包含21天真实对话的REALTALK数据集和评估AI长期记忆能力的LoCoMo数据集进行测试,发现仅保留自然提及的缓存行时,模型的回答准确率与孤立编码(重新阅读相关文字)几乎无差异,甚至在LoCoMo数据集上略低。这表明,自然对话中的随机提及无法可靠触发语义物化,信息写入需依赖专门设计的载体事件。
这一研究对AI记忆系统的评估提出了新挑战。传统方法认为,若删除某条记录后模型回答准确率不变,则该记录不重要。但研究发现,准确率不变可能是因为被删除记录的信息已转移到下游缓存行中。因此,评估记忆系统时,需考虑哪些缓存行可能继承了被删除记录的信息,而非仅依赖删除后的准确率变化。
论文编号为arXiv:2607.23693,题为《Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV》。研究者强调,语义物化现象揭示了AI记忆的深层机制——信息处理不仅是“读了就忘”,更会在计算过程中留下痕迹。对于工程师而言,这意味着可通过设计载体事件优化AI记忆管理;对于普通用户,则需认识到,AI的“记忆”可能包含比表面文字更复杂的计算逻辑。











