在AI大模型竞争日益激烈的当下,行业焦点已从单纯的模型参数规模转向更核心的技术能力突破。神州光大近日宣布,其基于深圳河套学院AI训练平台项目团队公开论文的技术路径,通过自主工程体系成功实现技术复现与优化,在国产算力环境下完成万亿参数级MoE模型全参数后训练,模型算力利用率(MFU)稳定突破34%大关。这一成果与论文在Ascend SuperPOD架构下取得的34.22%MFU数据高度吻合,较开源基线效率提升近3倍,标志着国产算力支撑下的AI训练技术正式迈入产业级应用阶段。
MoE(混合专家)模型作为当前大模型发展的重要方向,通过动态路由机制将参数规模推至万亿级别,同时保持单次推理的计算量可控。但这种架构对训练系统提出严苛挑战:跨专家通信的复杂性、显存碎片化问题、算子调度的碎片化以及长周期训练的稳定性,成为制约技术落地的关键瓶颈。神州光大技术团队针对这些难题,在国产算力底座上构建了系统性解决方案,重点攻克了流水线气泡压缩、通信计算重叠优化、双缓冲显存管理等核心技术,有效解决了算力被通信等待、显存碎片和无效空转消耗的痛点。
据技术白皮书披露,该方案通过重构训练流水线,将计算与通信重叠时间提升40%;采用动态显存分配策略,使显存利用率提高25%;通过智能算子融合技术,减少30%以上的碎片化计算。这些优化使万亿参数MoE模型在全参数后训练中,算力损耗降低至行业领先水平,为金融风控、智能制造、能源调度等高价值场景的模型迭代提供了可靠技术支撑。
随着技术验证的完成,神州光大正式启动规模化推广计划。该计划将围绕MoE模型优化、国产算力适配、真实业务场景落地三条主线,构建可复用的训练优化工具链。通过沉淀并行配置推荐算法、瓶颈自动诊断系统、算子深度优化库等核心能力,形成覆盖训练全流程的标准化解决方案。目前,团队已与多家金融机构达成合作,将技术应用于信贷风险评估模型的实时迭代,使训练周期缩短60%,硬件成本降低45%。
"34%的MFU不是技术终点,而是产业应用的起点。"神州光大董事长高峰在技术研讨会上强调,当前AI训练面临的核心矛盾是前沿技术与业务需求的脱节。公司下一步将重点解决模型迭代确定性问题,通过建立训练成本评估模型和稳定性预测系统,让客户能够精准预估技术升级带来的业务价值提升,真正实现从"实验室突破"到"商业化交付"的跨越。











