ITBear旗下自媒体矩阵:

国产超算“灵晟”携手清程极智:纯CPU架构跑通DeepSeek,开启超智融合新篇章

   时间:2026-08-08 01:46:13 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

国产超算领域迎来重大突破,清程极智与“灵晟”超算携手完成纯CPU MoE模型分布式推理方案,标志着国产算力在大模型应用领域迈出关键一步。该方案仅需16个节点即可流畅运行DeepSeek-V3/R1-671B模型,在batch_size=2048的条件下,输出吞吐量达到80张主流GPU集群的水平,为国产算力从基础设施向实际生产力转化提供了重要范本。

此次合作的核心在于突破传统超算与AI的界限,通过系统级协同优化实现算力、模型与推理软件的高效融合。传统超算主要服务于科学计算任务,而“灵晟”超算通过架构创新,将超算平台升级为可持续生产大模型Token的“工厂”。这一转变不仅满足了科学计算与AI深度融合的产业需求,更通过错峰运行机制最大化利用算力资源,为国产超算开辟了新的应用场景。

在硬件层面,“灵晟”超算采用原生超智融合架构,其自研的LX2 CPU集成矩阵加速单元并支持多精度计算,片上高带宽内存提供TB级带宽,较传统CPU实现十倍性能提升。网络方面,自研的“灵启”网络支持微秒级低时延传输,具备扩展至200万端口、10万节点的能力,有效解决了分布式推理中的通信瓶颈问题。这种软硬协同的设计理念,为大规模模型推理提供了坚实的硬件基础。

软件优化是释放硬件潜力的关键。清程极智针对LX2 CPU特性重构算子库,通过OpenMP与自研编译器实现计算算子,基于通信库构建通信算子。其统一并行加速库具备计算图语义扩展、共享内存加速等核心能力,通过精细化指令控制与异步流水线调度,将MoE推理时延从1440微秒降至980微秒。针对无依赖算子,团队采用动态线程池分配策略,使高并行度算子获得更多计算资源。

集群并行策略方面,LX2 CPU的NUMA架构与“灵启”网络特性与DeepSeek模型的专家并行架构高度契合。清程极智构建了张量并行、流水线并行、专家并行与数据并行的混合方案,在DeepSeek部署中采用EP256专家并行配置,节点内TP16、节点间DP16的组合方式,并针对Attention模块设计定制化并行策略。这种多层次优化使集群扩展性显著提升,充分释放了硬件算力密度。

MTP技术的引入进一步提升了推理效率。该技术通过单次推理生成多个token并并行验证,显著提高了单请求输出速率。研究团队深入分析了不同并发规模下MTP加速比与预测深度的关系,通过持续调优实现了推理性能与资源消耗的最佳平衡。这种技术创新使国产超算在保持低时延的同时,具备了与主流GPU集群竞争的吞吐能力。

此次技术突破的背后,是国产算力生态的系统性升级。“灵晟”超算提供的国产化硬件底座,与清程极智长期积累的推理优化技术形成完美互补。不同于简单的适配移植,清程极智基于国产算力架构特性进行原生优化,形成了覆盖硬件适配、算子迭代、集群优化等环节的系统化方法论。这种全链路优化能力,使国产超算能够高效转化为可量产的Token生产能力。

Token服务体系的建立,重新定义了算力评价标准。该体系突破传统以节点数量或峰值算力为核心的硬件评价模式,转而从token产出效率、单位算力成本、推理时延等产业维度衡量算力价值。这种转变促使国产算力从单一硬件资源向标准化AI生产力转化,为大规模商用落地奠定了基础。清程极智通过此次合作证明,国产自主可控的硬件搭配本土优化技术,完全能够实现高性能token量产。

在国产化赛道深耕多年的清程极智,已形成独特的竞争优势。其能力覆盖从硬件适配到token产出的全流程,能够针对不同国产算力载体实施精准优化。此次与“灵晟”超算的合作,不仅验证了纯CPU方案在大模型推理领域的可行性,更展示了国产算力在性价比、服务稳定性等方面的综合优势。随着国产算力生态的持续完善,这种软硬协同模式将为更多行业提供高效的AI解决方案。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version