ITBear旗下自媒体矩阵:

华为开源5050亿参数盘古新模型,长上下文智能体任务再进一步

   时间:2026-07-31 19:06:03 来源:天脉网编辑:快讯 IP:北京 发表评论无障碍通道
 

华为今日宣布开源其最新研发的盘古MoE模型openPangu-2.0-Pro,该模型基于昇腾NPU训练,总参数规模达5050亿,激活参数规模180亿,支持512K上下文长度,训练数据总量约34T tokens。这一成果标志着华为在大模型领域的又一次重要突破,同时也为智能体应用的发展提供了新的技术支撑。

openPangu-2.0-Pro是openPangu-2.0系列的最新成员,其技术架构实现了全面升级。在Attention架构上,该模型采用了DSA+SWA独立分层混合架构,层配比为1:2,其中SWA层负责局部窗口建模,DSA层负责稀疏全局聚合,这一设计在保持精度的同时显著降低了长序列推理的计算、显存与访存开销。拓扑架构方面,模型将传统残差连接升级为4支流mHC架构,有效提升了表征多样性与泛化能力。模型还引入了3头MTP架构的自投机模块,一次额外预测3个token,从而提升了推理速度。在训练过程中,模型采用了Muon优化器,获得了更快的收敛速度。

除了架构上的创新,openPangu-2.0-Pro还发现了一套正向协同反馈机制。底层性能强劲的基础推理能力能够直接支撑复杂智能体行为的运行,而智能体的持续运行又会反向迭代优化模型的多阶任务规划能力与长轨迹上下文处理水平。这一发现为模型在智能体应用中的表现提供了有力保障。

openPangu-2.0系列模型是专为长上下文智能体任务打造的。智能体应用要求模型能够执行长程任务、精准调用外部工具,并在长时间运行时保持认知一致性。然而,现有通用框架在部署时存在不少问题,如推理资源损耗大、上下文长度拖累模型表现等。针对这些问题,openPangu-2.0系列模型融合了自研硬件内核、整机系统架构、训推一体化智能体强化学习算法,并搭配了专属推理加速方案,搭建了一套完备的软硬件协同设计体系。

在性能评估方面,研究人员基于多个公开基准测试对openPangu-2.0模型进行了全面评估。虽然技术报告中未公开与第三方模型的对比结果,但提到在通用能力测试、推理任务、智能体等测试中,openPangu-2.0表现出色。特别是在处理复杂现实世界软件工程任务时,虽然与顶尖模型仍存在差距,但已展现出强大的潜力和竞争力。通用能力方面,openPangu-2.0-Flash和openPangu-2.0-Pro在多种通用测试中都表现优异,包括上下文学习、指令遵循以及多轮理解能力等方面。在世界知识及事实可靠性测试中,openPangu-2.0-Pro的表现更是远远超过了openPangu-2.0-Flash。

在训练基础设施方面,openPangu-2.0系列模型也进行了诸多优化。当模型拓展至512K上下文窗口,并叠加mHC、Muon、MTP等多重复杂基础架构单元时,会带来更高的通信开销与显存占用瓶颈。为此,研发人员搭建了一套系统化协同优化框架,融合了无冗余混合上下文并行、面向MTP的轻量化点对点数据传输、适配Muon优化器的分布式计算通信重叠机制以及混合重计算策略。同时,依托Ascend C专用编程语言定制融合内核,对mHC、参数化注意力汇点、模块化注意力等模块进行了深度加速。

预训练阶段,openPangu-2.0的预训练语料库包含约34T tokens,并被划分为三个阶段进行逐步提升。第一阶段是通用领域训练,重点在于建立扎实的通用知识和广泛的语言能力基础;第二阶段是推理能力培养,提升深度推理能力、逻辑思维能力以及高级编程技能;第三阶段是退火处理,优化模型行为和智能体的能力。后训练阶段则分为监督微调、并行强化学习专家训练、多专家在线策略蒸馏三级流水线进行。

在推理加速方面,华为自研了昇腾原生推理框架,实现了硬件执行逻辑与模型运行时动态行为的耦合。该框架自研了多款融合算子,并配套了Felix上下文并行、单核多流执行等并行策略。为提升推理吞吐,框架还搭配了定制量化方案与算子感知式保精度量化机制,并集成了混合KV缓存管理、无损并行分词等先进技术。在128K上下文长度下,openPangu-2.0-Flash版本最低TPOT时延可达5.63ms,在TPOT为15ms的工况下单卡NPU生成吞吐1846 token/s;openPangu-2.0-Pro版本最低TPOT时延9.55ms,TPOT 20ms条件下单卡吞吐1326 token/s。这些数据充分展示了openPangu-2.0系列模型在推理性能上的卓越表现。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version