ITBear旗下自媒体矩阵:

浙大团队新发现:AI大模型“专家”并非各司其职,而是“同频共鸣”

   时间:2026-08-12 03:33:40 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

浙江大学计算机科学与技术学院与香港理工大学航空工程系联合开展的一项研究,对人工智能领域前沿的大型语言模型设计提出了新见解。该研究以预印本形式发布,论文编号为arXiv:2607.28308,为理解稀疏专家混合模型的工作机制提供了重要依据。

稀疏专家混合模型(Mixture of Experts,MoE)是当前大型语言模型的主流架构之一,Mixtral、DeepSeek、OLMoE等知名模型均采用这种设计。其核心机制类似于大型餐厅后厨:拥有众多厨师,但每次仅调用少数几位参与烹饪。这种设计既保证了模型参数的庞大,又控制了单次计算的资源消耗。决定调用哪些专家的机制被称为"路由器",它根据当前处理的文字片段,从所有专家中筛选出得分最高的几位参与任务。

传统学术观点认为,被路由器选中的专家之所以有效,是因为它们各自掌握不同的知识领域,形成互补。这种假设被称为"几何互补性",即专家们的知识空间相互独立。然而,联合研究团队通过系统性实验发现,实际情况远比这一直觉复杂。

研究团队设计了三层验证体系,在六个主流MoE模型上进行了大规模测试。这些模型包括不同规模的OLMoE、Mixtral-8x7B、DeepSeek-MoE-16B等。第一层验证通过"专家子空间分离指数"(ESSI)测量专家间的知识差异,结果显示专家间的知识重叠程度远高于预期。以厨师比喻,不同厨师的菜系差异,与同一位厨师不同日期的烹饪风格差异相当。

进一步分析发现,每个专家的知识空间中,有27%至98%的内容与公共核心重合,具体比例取决于模型维度。这表明专家们主要处理相似的基础信息,仅在细节上存在差异。这一发现对"各司其职"的传统假设提出了挑战。

尽管专家知识高度重叠,但路由器的选择并非随意。实验表明,路由器实际选中的专家组合,比随机组合能多覆盖28%至90%的信息。这种选择性被称为"相干路由",即路由器能够从相似专家中挑选出最适合当前任务的组合。

研究中最反直觉的发现是关于专家间的"同伴效应"。按照传统假设,专家间的互补性应产生正向协同效应,但实验结果显示,实际协作团队中专家的额外贡献值反而低于随机团队。这种现象被称为"几何饱和":高度针对性的协作团队已覆盖大部分关键信息,留给新专家的发挥空间有限。

这一发现引发了新问题:既然新专家的线性贡献有限,为何多个专家仍能提升模型性能?进一步实验表明,尽管新增专家的线性贡献递减,但它们仍能通过非线性计算提供价值。就像多位风格相似的厨师共同烹饪,虽使用相似食材,但不同的烹饪手法能提升菜品质量。

研究还比较了领头专家与其他专家的贡献。在多数情况下,领头专家更重要,但在某些模型层次中,其他专家的集体贡献超过领头专家。这表明即使存在主导专家,其他专家的作用也不可忽视。

为更直接验证多专家的价值,研究团队设计了对照实验:在计算量相同的前提下,比较"1个宽专家"与"2个窄专家"的效果。结果显示,使用2个窄专家的模型在验证损失上显著优于使用1个宽专家的模型,证明专家数量增加确实能提升学习效果。

基于这些发现,研究团队提出了"相干重叠"概念来解释MoE模型的工作机制:专家知识在几何上高度重叠,但路由器能选择最适合当前任务的组合;多专家的价值不在于覆盖不同知识方向,而在于执行不同的非线性计算,形成功能互补。

这一发现对AI模型设计具有重要启示。在模型压缩方面,不能仅凭专家间的几何相似度判断冗余性,因为相似专家可能执行不同的非线性变换,删除任一专家都可能影响预测质量。在路由器设计方面,评价标准应从"选择不同知识方向的专家"转变为"选择最适合当前任务的专家组合"。对于自适应路由,增加专家多样性约束未必有效,更应关注新增专家对预测的实际改善量。

研究方法上,团队开发了多项创新测量工具。ESSI通过比较专家间距离与专家内部变化程度来量化知识重叠度;2×2因子实验使用"分数新颖度"指标测量专家在特定上下文中的额外贡献。所有实验结果均经过多种敏感性分析和数值验证,确保结论可靠性。

这项研究为理解大型语言模型的工作机制提供了新视角,强调在评估专家价值时,应关注其实际改善输出质量的能力,而非单纯的知识领域差异。对于希望优化或重新设计AI模型的工程师和研究人员,这一发现具有重要的实践指导意义。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version