在世界人工智能大会的展台上,一组组黑色机柜吸引了众多观众的目光,上面“超节点”的标识格外醒目。人们纷纷驻足,有的拍照打卡,有的向工作人员咨询相关参数。超节点,这个在大会上频繁出现的热词,正成为人工智能行业关注的焦点。
要理解超节点,需先了解“通信墙”问题。如今,单张AI芯片难以满足AI大模型的计算需求,通常采用Scale - out(横向堆叠)方式组成超大集群,将任务拆分处理。然而,这种方式存在“算得快、传得慢”的弊端。有数据显示,在超高参数级别的大模型训练中,计算单元约40%的时间都在“空等”通信。而超节点则是通过放大Scale - up(纵向堆叠)范围,让更多芯片以高带宽、低时延的方式连接,如同超级计算机般协同高效工作。以服务器为例,往每台服务器中塞入多张GPU芯片就是Scale - up,此时每台服务器成为一个节点,再将多个节点连接起来就是Scale - out。
此次大会上,华为昇腾950超节点备受瞩目,这是其真机首次亮相。从数据上看,它单柜配备64卡,共有16台计算柜、4台灵衢柜,支持1024张AI芯片卡高速互联。而且,1024卡并非它的极限,华为工作人员表示,其真正上限是8192卡,此次仅展出20个机柜、1024卡的配置,预计年底投入商用,这是目前业界最大规模的超节点。此前,DeepSeek就曾表示,随着下半年昇腾超节点全系列产品批量上市,其Pro版价格有望大幅下调。
在AI算力领域,关注点正从“单颗芯片的性能”向集芯片、有效算力、散热、运维等于一体的系统方案转变。多家厂商都带来了各具特色的超节点,如中兴通讯的中兴OEC超节点、新华三的UniPoD S80000超节点、阿里云的磐久AL128超节点以及昆仑芯32/64卡超节点等。
以线缆问题为例,业内人士介绍,通常机柜通过铜缆、光纤等互联,但这些线缆会带来性能损耗、运维复杂度高、故障点多等难题。中兴通讯联合多家合作伙伴打造的Matrix超节点,以OEX正交超节点为基座,采用正交无背板设计,实现了零线缆,互联成本降低80%,运维效率显著提升。
壁仞科技相关负责人在现场表示,当下国产算力选择“体系化突围”,不依靠单颗芯片硬拼,而是借助超节点这类系统级创新,将上千颗国产芯片整合成高效协同的算力整体。同时,算力集群在系统方案上也有新突破。十万卡AI超集群曙光8000真机首次公开亮相,它打通了芯片、计算、存储、网络、散热、应用和服务等关键环节,以全链路协同满足十万卡规模下多类型任务的复合计算需求。
散热对于算力至关重要。Frore Systems联合创始人兼CEO Seshu Madhavapeddy在世界人工智能大会上给出数据,若GPU芯片温度升高,性能效率指标会急剧下降,同一块GPU运行温度从65度升到90度,会损失30%的效率。中科曙光工作人员介绍,曙光8000采用浸没式液冷散热系统,所有核心元部件浸没在不导电的特殊液体中,能源利用率大幅提升,实验室的PUE值可低至1.04,即用1000瓦的电计算,只需40瓦的电散热。
算力已成为AI时代的基础设施,但超节点、超集群目前还无法彻底解决算力紧缺问题。香港城市大学计算机学院教授林静认为,当前AI尚未完全融入人类生活生产,若未来大规模使用,所需算力庞大,需考虑地球资源能否满足。在她看来,解决算力紧缺有三种可能方向:一是提升人工智能效能;二是探索新计算范式,如发展量子计算等,因为当前冯·诺依曼经典计算框架在处理特定复杂问题时,逐渐暴露出“存储墙”、组合爆炸等固有效能瓶颈问题;三是发展太空算力,减少对地球资源的消耗。
以太空算力为例,已有组织和企业推动其发展。在世界人工智能大会“未来计算·未来算力”论坛上,上海“星枢计划”太空算力星座正式发布,该项目由复旦大学联合上海星枢天算航天科技牵头研制运营,总规划1000颗天基算力卫星。
不过,有业内人士称,太空算力最早由马斯克等企业家提出,受限于美国的供电环境。而在中国,完善的电力设施等资源足以支撑开发所需的地球算力。同时,中国算力网也有了一定发展。鹏城实验室主任、中国工程院院士高文在前述论坛中表示,中国算力网发展需经历三个阶段:算力资源汇聚;在算力汇聚基础上,面向特定用户群体开展协同运算;运营模式成熟后,算力网面向社会开放。目前,第一阶段任务已完成70%,全国70%的算力资源已纳入实时更新的统一数据库,该数据库提供给国家数据局使用,可实时展示各算力中心的运行状态等。不同组织和个人都在为解决算力紧缺问题积极探索。












