阿里云近日宣布,其自主研发的真武M890超节点实例已成功适配Kimi K3大模型,成为国内首个支持近3万亿参数规模运行的超节点系统。这一突破标志着国产算力在支撑超大规模人工智能模型方面迈出关键一步,为万亿级参数模型的商业化应用提供了硬件基础。
Kimi K3模型拥有2.8万亿参数,其运行需要将参数分散至数十甚至上百块GPU卡进行协同计算。传统AI集群受限于通信带宽,难以满足模型训练和推理过程中对高吞吐、低延迟的严苛要求。阿里云研发的真武超节点系统通过硬件架构创新,有效解决了这一技术瓶颈。
核心硬件真武M890芯片采用自主设计的并行计算架构,集成144GB显存容量。基于该芯片打造的磐久AL128超节点服务器,通过自研互联芯片实现单机柜128块GPU卡的紧密耦合,点对点通信延迟控制在150纳秒以内。这种设计使64块真武M890芯片通过ICN Switch 1.0互联芯片达成800GB/s的超高带宽,整体显存规模扩展至9TB。
在软件优化层面,阿里云联合平头哥半导体与Kimi研发团队,针对模型架构特点进行深度适配。通过对核心算子的专项优化,显著提升了推理过程中的算力利用率和带宽效率。实测数据显示,优化后的系统使模型首个Token生成延迟降低35%,单卡解码吞吐量提升至原来的1.8倍,能够稳定处理百万级长文本上下文场景。
随着千问AI平台和阿里云百炼平台同步开放Kimi K3的API服务,这项技术突破将直接惠及开发者社区。两个平台的协同运作,为不同场景下的模型部署提供了标准化解决方案,降低了超大参数模型的应用门槛。
当前全球主流AI模型已进入超2万亿参数时代,阿里云真武超节点的成功实践,验证了国产算力体系支撑超大规模模型运行的技术可行性。这项突破不仅填补了国内在该领域的技术空白,更为人工智能技术的产业化应用开辟了新的可能性。











