在人工智能领域,多模态大语言模型正逐渐成为新一代技术的基石,然而其训练系统却长期面临一个棘手难题:追求计算速度时,显存容量往往难以满足需求;而节省显存时,训练速度又会大幅下降。小红书的dots infra团队将这一困境称为多模态流水训练的“帕累托前沿”,如今他们成功打破了这一局限,推出了一种全新的训练范式。
多模态模型的结构复杂,并非传统意义上的规整transformer。一个典型的多模态大语言模型(MLLM)由三个主要部分构成:模态编码器负责将图像、音频等数据转换为嵌入向量;LLM主干在这些嵌入向量上进行推理;生成器则将LLM的输出重新映射回图像、语音等目标模态。由于这三部分在结构和功能上差异显著,将它们整合到同一条训练流水线中时,便产生了诸多挑战。
此前,业界主要采用两种解决方案。第一种方案注重计算效率,将编码器和生成器从LLM流水线中分离出来独立运行。这种设计的好处是模态模块的耗时波动不会影响LLM流水线的运行,但缺点是激活显存会随着microbatch数量的增加而急剧膨胀,在大规模生产环境下成本高昂。第二种方案则侧重显存效率,将所有模块整合到同一条流水线中,虽然激活生命周期缩短、显存占用降低,但只要某个编码器或生成器运行较慢,整个LLM流水线就得等待,导致尾部出现空泡现象。随着模型规模的扩大,这两种方案的局限性愈发明显。
针对这一问题,BigMac提出了一种创新思路:以高度优化的LLM流水线作为调度主干。大规模LLM训练早已依赖成熟的调度策略,如1F1B或interleaved1F1B,这些策略与生产级训练栈深度融合。BigMac并未替换这些现有策略,而是将其作为底层时间线,将编码器和生成器的计算任务插入到输入就绪且不会干扰LLM执行顺序的位置。团队将这种设计称为“准依赖安全的嵌套流水线”。
这一设计带来了两大显著优势。首先,编码器和生成器的耗时波动不再沿LLM流水线传导,LLM能够按照自身的节奏稳定推进。其次,通过算法层面的优化,模态激活显存被压缩至O(1)级别,编码器无需为所有microbatch保留激活数据直至流水线结束,生成器也不必携带冗长的激活尾巴。这意味着BigMac并非在显存和空泡之间进行权衡,而是通过重构调度结构,使这两个目标不再相互冲突。
从设计调度策略到实际实现训练,中间涉及系统集成、接口定义和性能排查等一系列工程挑战,而BigMac正是为解决这些问题而生。它提供了三项关键工具:第一,全局调度可视化。运行时的Scheduler会生成一张覆盖所有pipeline rank、microbatch和模块类型的全局操作符表,Executor再将其拆解为每个rank的本地序列,并分配给Megatron Core等LLM后端、模态运行时和通信后端。这种设计使调度策略透明化,便于检查且对后端友好。第二,用户友好的流水并行接口。算法工程师只需描述每个模块的输入输出关系,其余的stage划分、激活与梯度交接、跨设备通信等复杂操作均由BigMac在底层自动处理,使得单卡验证的多模态实验能够更顺畅地扩展到流水并行环境。第三,一套完整的分析工具链,包括profiler、simulator和可视化工具。这些工具能够将训练迭代拆解至操作符级别,帮助用户清晰了解每个rank在每个时间点的计算状态、空转情况以及依赖阻塞点;simulator还能在正式训练前模拟不同的PP配置和microbatch组合,预测其对空泡和吞吐量的影响。
BigMac的实际效果在两类典型任务中得到了验证。在MLLM-Understanding任务中,以Qwen3-30B-A3B作为主干模型,搭配1.3B参数的ViT编码器,与计算高效基线Optimus相比,BigMac的训练速度提升了1.08至1.1倍;与显存高效基线Megatron-DistTrain相比,速度提升了1.6至1.9倍。更关键的是,随着per-GPU batch size的增加,BigMac的峰值显存保持稳定,而Optimus因需保留编码器激活数据,显存持续攀升,最终在更大batch size下因显存不足而失败。在更复杂的MLLM-Generation任务中,模型额外增加了一个20B参数的MMDiT生成器,差异进一步放大:Optimus在所有测试batch size下均因显存不足而失败,而BigMac通过及时运行generator backward操作、快速释放生成器侧激活数据,成功避免了这一问题,相比Megatron-DistTrain仍实现了1.5至1.9倍的加速,且显存占用保持稳定。这一结果充分体现了嵌套流水线在同时处理编码器和生成器依赖、避免大量激活驻留或严重空泡方面的优势。
目前,BigMac已成为小红书多模态模型训练的核心组件之一,并在其生产环境中稳定运行。相关研究论文《BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training》已发布在arXiv平台上,团队还同步公开了交互式PP Profiler的跟踪示例。对于正在为多模态训练的显存和速度问题而困扰的研究者和工程师而言,这一经过生产验证的开源方案或许能够大幅减少重复开发的工作量。











