ITBear旗下自媒体矩阵:

国产芯片厂商竞逐超节点赛道:以系统协同破局算力与工艺双重挑战

   时间:2026-07-25 15:26:25 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在今年的WAIC展会上,超节点成为科技领域备受瞩目的焦点。华为、阿里、沐曦、中兴通讯等众多底座厂商纷纷展示并推出各自的超节点产品,如华为的昇腾950超节点、阿里磐久AL128超节点、沐曦的曦景S系列超节点以及中兴通讯的OEX超节点等,一时间超节点概念在行业内掀起热潮。

超节点并非一个新出现的概念,早在2023年英伟达就已提出。其核心原理是通过高速总线将内部GPU进行互联,以此支撑起更大规模的计算任务,加速GPU之间的参数交换与数据同步,进而缩短大模型的训练周期。英伟达的这一创新举措,使得芯片厂商的业务模式从单纯售卖GPU转变为通过AI超级计算机提供算力基础。

国产芯片厂商纷纷入局超节点领域,背后有着深刻的产业逻辑。一方面,行业需求发生了显著变化。随着大模型从训练阶段逐渐转向推理阶段,单块GPU的性能已难以满足需求,边际效应日益凸显,必须依靠系统集成间的信息互联来支撑更大的算力需求。另一方面,国产AI芯片厂商的竞争格局也在改变,从以往的单点突破迈向系统协同,从单纯的芯片竞争升级为AI基础设施竞争。

从国内现实情况来看,国产芯片厂商与英伟达在单颗GPU性能上存在较大差距。一家头部国产芯片厂商的技术工程师透露,目前国内芯片厂商在制造能力上与全球顶尖厂商仍有距离,这体现在制造工艺、良率等多个方面。以该厂商目前的产品为例,基本可对标英伟达H20产品,但与英伟达下一代Rubin产品的算力相比,仍有1代到1.5代的差距,而这一差距主要源于生产工艺。良率问题也是制约国产芯片发展的重要因素,一些全球顶尖厂商生产芯片时,100颗中有90颗都能正常使用,良率高意味着浪费少,这是常年积累的经验所致。国内大部分厂商目前还难以达到这样的良率水平,从50%提升到90%至少需要3 - 5年时间。然而,当前AI需求爆发迅猛,没有足够时间等待技术提升,因此只能通过其他集成方式来提高整体性能。

传统上,厂商试图通过堆卡来弥补性能不足,但随着算力需求的急剧膨胀,单纯的堆卡集成已无法提供有效算力,芯片之间的互通互联成为提升整体算力的关键。天数智芯副总裁石加圣用一个形象的例子解释了这一原理:一张内容丰富、时间有限的试卷,即便能力很强的人也难以独自完成全部题目。如果简单增加做题人数,但大家各自为战、重复劳动,最终效果未必理想。更有效的方式是将任务合理拆分,让不同的人并行完成各自负责的部分,同时通过高效的信息传递和统一调度及时汇总结果,这样个人能力才能真正转化为团队的整体能力。在超节点领域,去年华为的CloudMatrix384超节点AI集群就提供了很好的思路,今年这一思路迅速在国产头部厂商中得到推广。

在WAIC展会上,各家厂商展示了超节点产品的强大性能。华为Atlas 950 SuperPoD能够提供1 EFLOPS FP8、2 EFLOPS FP4算力;曙光8000的单个计算单元密度较其他超节点提升20倍,同时采用自研scaleFabric类IB原生RDMA无损高速互连技术,实现十万卡规模超高速稳定互连。天数智芯的超节点面向大模型训练与高并发推理场景,以国产通用GPU为核心,实现144芯高速全互联,通过高带宽互联、统一资源调度和软硬件协同优化,提供稳定、可靠、可扩展的高质量算力;燧原科技与中兴通讯合作的云燧ESL64 - O超节点,将Scale - up和Scale - out进行融合,可横向扩展到16384集群超节点。

尽管超节点的研发和部署成本极高,现场展示的部分超节点机柜,一个核心算力单元的价格就上亿元,但各大厂商仍积极投入,这主要源于市场对算力的急剧膨胀需求以及企业需求从训练模型向推理模型的转变。相较于模型训练,面向大规模用户的在线推理服务需要同时满足高吞吐和低延迟要求。对于无法由单卡容纳的大模型,以及采用张量并行、专家并行或Prefill/Decode分离的推理系统,GPU之间需要频繁交换激活数据、Token或KV Cache,因此对互联带宽和通信延迟提出了更高要求,这也是产业界发展超节点并进行系统级优化的重要原因。

石加圣指出,随着大型模型的参数量和上下文长度持续增加,单卡显存容量和计算能力往往难以满足训练或高性能推理需求,因此需要采用数据并行、张量并行、流水线并行或专家并行等方式在多个GPU之间切分计算任务。传统集群主要通过高速网卡实现跨服务器通信,而超节点进一步扩大了高带宽、低延迟的Scale - up互联域,能够降低部分跨GPU通信的开销。当前越来越多的大型模型采用MoE架构,专家并行会带来频繁的跨GPU Token路由和All - to - All通信,对互联带宽、通信延迟和软件通信效率要求较高。对于通信密集型的大规模MoE训练和推理任务,超节点有望减少跨节点通信开销,并在满足一定利用率和业务规模的条件下提升整体性能与性价比。

中科曙光技术工程师王德志认为,系统规模扩大后,复杂度并非简单线性放大。一方面,大规模并行计算需要整个系统高度协同,任何网络或计算短板都会使性能大幅损失,必须保证规模扩展时性能效率近似线性增长;另一方面,随着部件数量上升,故障概率也会大幅增加,进一步增加了保证系统可靠性的难度,这其中涉及到通讯、功耗、散热等一系列问题。

在国内芯片性能存在差异且面临“卡脖子”问题的当下,超节点成为一种有效的解决方案。摩尔线程副总裁马鉴表示,超节点要解决的是用更高密度去解决单卡无法解决的问题,通过系统提升来对标国际先进的超大规模集群,训练出同样先进的模型。石加圣认为,中国拥有庞大的制造业基础以及强大的产业协同、系统集成和场景落地能力。对于算力产业而言,单颗芯片在工艺和性能上的进步固然重要,但最终交付能力不仅取决于单个指标,还取决于芯片、封装、存储、互联、软件栈和整机系统之间的协同。面对部分环节的短板,可以通过架构创新和系统级优化进行一定程度的缓解,通过综合评估性能、功耗、成本和工程复杂度等方式来确认替代方案的可行性。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version