北京大学深圳研究生院、鹏城实验室与中山大学联合开展的一项研究,为视觉语言大模型的调度机制优化提供了新思路。这项研究聚焦于专家混合模型(Mixture of Experts,MoE)中的负载均衡问题,发现传统调度策略在处理图文混合输入时存在系统性缺陷,并提出名为ReBA的改进方案,在降低负载不均衡度的同时保持任务准确率。
在AI语言模型中,MoE机制通过多个独立计算单元(专家)分工处理信息,路由器负责将输入分配给不同专家。然而,当模型同时处理文字和图片两类模态时,传统调度策略(如Std-Aux)仅计算混合数据的总体均衡度,导致图片和文字的负载偏差相互抵消。例如,某专家可能因处理大量图片而超载,另一专家则因处理文字而空闲,但总体统计显示系统均衡,这种“表面均衡”在图片比例变化时会迅速崩溃。
研究团队通过实验发现,在Split-Qwen3VL-4B模型中,当图片分辨率从低到高变化时,使用Std-Aux训练的路由器负载不均匀度差异超过五倍。进一步分析显示,图片负载和文字负载的Pearson相关系数高达-0.949,L1条件差距达0.798,表明两类负载的分配方向几乎完全相反,但混合后因抵消效应被误判为均衡。这种现象被称为“模态互补负载”,是传统调度策略失效的根本原因。
为解决这一问题,研究团队提出ReBA方案,其核心思想是“内部放宽,边界均衡”。具体而言,ReBA将图片和文字的负载优化目标彻底分离,要求两类模态各自独立实现均衡,避免偏差抵消。同时,ReBA以每张完整图片为单位评估负载均衡度,而非单个图像块。例如,一张高清图片被分割为1000个图像块,与一张小图片的10个图像块在优化目标中权重相同,确保不同分辨率图片的公平性。文字部分则保持整体评估,避免因样本间差异过大导致分组失衡。
实验结果显示,ReBA在四款分割型视觉语言模型上均显著降低了负载不均匀度。以Split-Qwen3VL-4B为例,其平均层变异系数(CV)从Std-Aux的0.43降至0.16,降幅超六成,而任务准确率仅微降0.3个百分点。在抗扰动测试中,ReBA在五种不同分辨率下的表现均优于Std-Aux,最高分辨率下聚合RMS-CV从0.351降至0.115。ReBA在InternVL模型的多tiles测试中,每个分块数量下的负载不均匀度均低于Std-Aux。
在计算效率方面,研究团队设计了一个理想化代理指标,衡量负载均衡对推理速度的影响。结果显示,在中等到高分辨率图片设置下,ReBA相比Std-Aux可将瓶颈计算量降低约20%,表明更均衡的负载分配有助于减少多设备并行推理中的等待时间。然而,研究团队也指出,实际推理速度还受设备通信、内存带宽等因素影响,理想加速比与真实性能之间仍存在差距。
值得注意的是,原生稀疏大模型(如Qwen3-VL-MoE-30B和Qwen3.5-MoE-35B)同样存在模态互补负载问题。诊断测试显示,这两款模型在图片和文字端的RMS-CV均高于混合值,且物理分辨率变化会同时影响图文比例和条件负载轮廓。例如,35B模型在高分辨率下因条件轮廓变化,实际负载反而下降,说明固定轮廓定律无法完全捕捉现实场景的复杂性。
目前,ReBA方案已在分割型模型上得到验证,但其对原生MoE模型的优化效果尚未通过训练实验确认。物理预处理对条件负载轮廓的影响、理想加速比与真实性能的差距等问题,仍需后续研究进一步探索。相关论文已以预印本形式发布,编号为arXiv:2608.00574,感兴趣的读者可查阅完整内容及数学推导。











