ITBear旗下自媒体矩阵:

大模型“外挂记忆卡”新突破:专业提升,通用能力稳如泰山

   时间:2026-08-19 17:46:13 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

当医生学习新的诊疗指南时,他们依然能轻松找到回家的路,这得益于人类大脑的独特能力——学习新知识时不会完全遗忘旧技能。然而,对于当前的大型语言模型而言,这一能力却成为难以突破的瓶颈。在训练过程中,模型一旦学习新的领域知识,往往会覆盖原有的基础能力,这种现象被称为“灾难性遗忘”,自1989年被提出以来,始终困扰着人工智能领域的发展。

近期,上海交通大学LUMIA实验室与上海人工智能实验室的研究团队针对这一问题提出了创新解决方案——MemSFT。该方法通过将专业知识存储于独立的外部记忆模块中,避免直接修改主干模型的参数,从而在提升专业能力的同时,最大限度保留模型的通用能力。实验数据显示,在80亿参数的模型上应用MemSFT后,生物学任务得分从5.07跃升至37.34,而通用能力平均分仅从80.56下降至67.04,数学推理能力的跌幅也显著低于传统方法。当模型参数扩展至140亿时,数学分数仅从96.4降至31.2,远优于全参数微调导致的近乎崩溃的表现。

传统方法中,全参数微调通过调整所有参数来适应新领域,虽能快速提升专业能力,但会严重破坏原有知识结构;而LoRA(低秩适配)虽仅训练部分参数,仍存在“学得越多、忘得越多”的线性反比关系。例如,在140亿参数模型上,LoRA将生物学任务分数从6.64提升至32.07,但通用能力平均分从83.22降至73.61,指令遵循能力更是暴跌近一半。研究团队通过类比书房整理进一步解释:全参数微调如同清空整个书架重新摆放,LoRA则类似仅腾出一个小格子,但动作中仍会碰倒周边书籍,而MemSFT的思路则是直接添加一个独立的外接硬盘。

MemSFT的核心在于构建“外部参数化记忆”模块,该模块与主干模型完全解耦,通过模仿检索行为内化领域知识。具体实施分为三步:首先,利用目标领域数据构建“数据存储库”,将隐藏层表示与真实答案存储为键值对,形成参考索引;其次,训练记忆模型学习检索出的概率分布,而非直接依赖实时检索,从而提升推理效率;最后,引入轻量级“路由器”动态决定每个生成词参考记忆模块的比例,其输出系数基于主干与记忆模型的隐藏状态、输出分布的置信度等信号实时调整。实验表明,在140亿参数模型与80亿参数记忆模块的组合中,生物学任务分数达42.92,通用能力平均分甚至略高于原始模型。

路由器机制的精细设计是MemSFT的关键突破。以地质学任务为例,路由器对普通功能词的参考比例(λ值)多在0.1至0.3之间,而涉及具体数值时λ值接近1.0,表明其能精准判断何时需要调用专业知识。进一步分析显示,数学计算中的数字λ值仅0.02至0.03,法律领域的常识选择题答案tokenλ值甚至低至0.001,均由主干模型处理;而地质学中的物理测量数值λ值高达0.99,体现路由器对任务复杂度的深度理解。这种动态调整能力使模型在处理简单任务时保持高效,在面对复杂领域问题时则充分调用专业知识。

MemSFT的另一优势在于记忆模块的跨模型复用性。研究团队在Qwen3系列模型中验证,同一生物学记忆模块可直接应用于80亿至2350亿参数的不同规模主干模型,均能稳定提升专业能力且不影响通用性能。在2350亿参数模型上,该方法将生物学任务分数从1.14提升至42.05,通用能力平均分甚至从87.07微涨至87.11。算力成本对比显示,全参数微调四个规模模型需41.05 EFLOPs,LoRA需27.37 EFLOPs,而MemSFT仅需9.23 EFLOPs,仅为全参数微调的22%。这一效率提升源于记忆模块与数据存储库的共享机制,仅需针对不同主干模型单独训练轻量级路由器。

为验证方法的普适性,研究团队在地质学与法律领域展开交叉实验。在地质学任务中,MemSFT将预测误差(RMSE)从103.07降至0.47,优于全参数微调的0.51,同时通用能力平均分从80.56提升至81.13;在法律领域,该方法使LawBench分数达56.47,高于全参数微调与LoRA的55分左右,且通用能力几乎无损失。更换模型家族后,130亿参数的LLaMA2模型配合70亿参数记忆模块,专业能力提升51%的同时通用能力仅轻微波动。这些结果证明,解耦记忆与主干的架构设计是方法有效的核心原因,而非针对特定模型的优化。

针对“直接使用检索增强生成(RAG)是否更简单”的疑问,研究团队通过对比实验发现,基于BM25算法的RAG在生物学任务中仅将平均分从6.64提升至12.23,远低于MemSFT的42.92。这表明,简单拼接检索结果与提示词的方式,无法使模型真正理解并运用知识,而经过专门训练的记忆模块能内化知识运用方式,形成更贴近任务需求的解题能力。研究也指出当前方法的局限性:记忆模块的复用依赖于模型共享词表,跨架构迁移需额外对齐工作,这一挑战为未来研究提供了新方向。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version