ITBear旗下自媒体矩阵:

华为云Tokens服务接入384超节点,突破AI算力增长瓶颈

   时间:2025-08-29 14:59:28 来源:ITBEAR编辑:快讯团队 IP:北京 发表评论无障碍通道
 

在第四届828 B2B企业节盛大开幕的当天下午,华为云传来了一则令人瞩目的消息:其Tokens服务已成功全面融入CloudMatrix384超节点,这一融合标志着华为云在AI算力领域的又一次重大突破。

得益于xDeepServe架构的创新应用,华为云Tokens服务的性能得到了显著提升。具体而言,该服务在单芯片上实现了2400TPS的吞吐量,同时保持了50ms的TPOT(Token处理时延),这一成绩无疑为AI算力的应用树立了新的标杆。

近年来,中国AI算力需求呈现出爆炸式增长。数据显示,从2024年初至2025年6月底,中国的日均Token消耗量从1000亿激增到30万亿,短短一年半时间内增长了300多倍。这一趋势对算力基础设施提出了前所未有的挑战。为了满足这一需求,华为云在2025年3月推出了基于MaaS(模型即服务)的Tokens服务,提供了多种规格以满足不同应用场景的需求。

此次Tokens服务与CloudMatrix384超节点的结合,更是将这一服务的性能推向了新的高度。依托超节点的xDeepServe框架,Tokens服务的吞吐量从年初的1920TPS跃升至2400TPS。这一提升的背后,是华为云对于大算力构建全栈创新的深刻理解,包括硬件、软件、算子、存储、推理框架及超节点等各个环节的协同优化。

xDeepServe架构作为CloudMatrix384超节点的原生服务,其创新之处在于采用了Transformerless极致分离架构。这一架构将MoE大模型拆解为Attention、FFN、Expert三个可独立伸缩的微模块,并通过微秒级XCCL通信库与FlowServe自研推理引擎进行高效整合。经过这样的优化,单卡的吞吐量从非超节点的600tokens/s大幅提升至2400tokens/s。

华为云还透露了xDeepServe架构的未来发展计划。目前,该架构已经实现了MA分离,未来还将进一步将Attention、MoE、Decode改造为数据流,并扩展至多台超节点,以实现推理吞吐的线性提升。

在应用层面,华为云Tokens服务已经支持了包括DeepSeek、Kimi、Qwen等在内的主流大模型,以及versatile、Dify等主流Agent平台。同时,华为云还与超过100家合作伙伴携手,在多个领域开发AI Agent,如调研分析、内容创作、智慧办公、智能运维等。这些应用不仅提升了服务效率与客户满意度,还推动了政企办公的智能化转型。

例如,基于MaaS平台的今日人才数智员工解决方案,通过集成自然语言处理、机器学习等技术,为企业提供了智能化的人才管理服务。而北京方寸无忧科技开发的无忧智慧公文解决方案,则利用AI技术实现了公文的自动化处理,大大提高了办公效率。

举报 0 收藏 0 打赏 0评论 0
 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version