在世界人工智能大会的展台上,一组组黑色机柜吸引了众多参观者的目光,机柜上“超节点”的标识格外醒目。观众们纷纷驻足,有的拍照打卡,有的向工作人员咨询相关参数。如今,“超节点”已成为大会上备受关注的热词,它究竟是什么,又为何引发如此高的关注呢?
要理解超节点,需先了解“通信墙”问题。当前,单张AI芯片难以满足AI大模型的计算需求,通常采用Scale - out(横向堆叠)方式,将多张芯片组成超大集群。然而,这种方式会导致“算得快、传得慢”的困境。有数据显示,在超高参数级别的大模型训练中,计算单元约40%的时间都在“空等”通信。而超节点则通过放大Scale - up(纵向堆叠)范围,让更多芯片以高带宽、低时延的方式连接,如同超级计算机般协同高效工作。
在此次大会上,华为昇腾950超节点成为焦点,这是其真机首次亮相。从数据上看,它单柜配备64卡,包含16台计算柜和4台灵衢柜,支持1024张AI芯片卡高速互联。而且,1024卡并非其极限,华为工作人员透露,其真正上限是8192卡,此次仅展出20个机柜、1024卡的配置,预计年底投入商用,这堪称目前业界最大规模的超节点。
超节点的出现,标志着AI算力竞争从“拼芯片”转向“拼系统”。如今,行业关注点已从单颗芯片性能,转移到集芯片、有效算力、散热、运维等于一体的系统方案。以线缆为例,传统机柜通过铜缆、光纤等互联,存在性能损耗、运维复杂、故障点多等问题。而中兴通讯联合合作伙伴打造的Matrix超节点,以OEX正交超节点为基座,采用正交无背板设计,实现零线缆,互联成本降低80%,运维效率显著提升。
壁仞科技相关负责人表示,当下国产算力选择“体系化突围”,不依赖单颗芯片硬拼,而是依靠超节点这类系统级创新,将上千颗国产芯片整合为高效协同的算力整体。与此同时,算力集群在系统方案上也有新突破。十万卡AI超集群曙光8000真机首次公开亮相,它贯通芯片、计算、存储、网络、散热、应用和服务等关键环节,以全链路协同满足十万卡规模下多类型任务的复合计算需求。
散热是系统方案中的重要一环。Frore Systems联合创始人兼CEO Seshu Madhavapeddy指出,GPU芯片温度升高会导致性能效率指标急剧下降,同一块GPU运行温度从65度升至90度,会损失30%的效率。中科曙光工作人员介绍,曙光8000采用浸没式液冷散热系统,所有核心元部件浸没在不导电的特殊液体中,能源利用率大幅提升,实验室PUE值可低至1.04,即用1000瓦电计算,仅需40瓦电散热。
尽管超节点、超集群等为算力发展带来新机遇,但目前仍无法彻底解决算力紧缺问题。香港城市大学计算机学院教授林静认为,当前AI尚未全面融入人类生活生产,若未来大规模使用,所需算力庞大,需考虑地球资源能否满足。她提出三种可能方向:提升人工智能效能;探索新计算范式,如发展量子计算等,因为当前冯·诺依曼经典计算框架在处理特定复杂问题时,已暴露出“存储墙”、组合爆炸等固有效能瓶颈;发展太空算力,减少对地球资源的消耗。
以太空算力为例,已有组织和企业积极推动。在世界人工智能大会“未来计算·未来算力”论坛上,上海“星枢计划”太空算力星座正式发布,该项目由复旦大学联合上海星枢天算航天科技牵头研制运营,总规划1000颗天基算力卫星。不过,也有业内人士表示,太空算力最早由马斯克等企业家提出,受限于美国供电环境,而在中国,完善的电力设施等资源足以支撑开发所需的地球算力。
中国算力网也在不断发展。鹏城实验室主任、中国工程院院士高文在该论坛中介绍,中国算力网发展需经历三个阶段:算力资源汇聚;面向特定用户群体开展协同运算;运营模式成熟后向社会开放。目前,第一阶段任务已完成70%,全国70%的算力资源已纳入实时更新的统一数据库,该数据库供国家数据局使用,可实时展示各算力中心的运行状态等。不同组织和个人都在为解决算力紧缺问题积极探索,算力发展正迈向新的阶段。








