ITBear旗下自媒体矩阵:

从算力“空转”到Token工厂:国产AI算力如何破解“用不起来”的困局?

   时间:2026-09-14 17:33:55 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

国内某中小企业技术负责人近期遭遇棘手挑战:采购的国产GPU卡虽标称算力达到国际主流产品七八成,但实际运行开源大模型时,输出速度仅为理论值的十分之一。团队耗时两周仍未解决部署问题,这一困境并非个例,而是当前中国AI产业普遍面临的转型阵痛。

国家数据局数据显示,中国日均AI词元调用量从2024年初的千亿级飙升至2026年3月的140万亿次,但信通院调查发现,国内智算中心GPU平均利用率不足30%。这种"需求爆炸"与"资源闲置"的矛盾,暴露出AI基础设施建设的深层问题:当算力采购从"硬件竞赛"转向"效能比拼",如何让昂贵的加速卡真正转化为生产力成为行业核心命题。

行业调研揭示了技术落地的具体障碍。IDC报告指出,近半数企业智算资源利用率集中在51%-70%,6.7%的企业甚至低于50%。自建智算项目普遍存在"重硬轻软"现象,服务器上架后缺乏统一调度平台和动态分配机制。GPUStack CEO秦小康透露,企业部署大模型时,80%的故障源于两类问题:要么模型根本无法运行,要么性能远低于预期。这种困境源于模型、推理后端与硬件的复杂适配需求——市面上数十种硬件型号、3600多个公开模型与十多种推理后端的组合,形成近乎阶乘级的复杂度。

中科曙光高速网络互联产品部总工程师万伟指出,决定Token生成效率的关键不仅是算力本身,更是算力、网络与存储的数据流转效率。随着模型规模扩大,分布式架构成为必然选择,但节点间通信时延成为效率瓶颈。行业数据显示,万卡级分布式训练中,网络通信耗时占比达30%-50%。特别是长上下文场景下,KV Cache数据量可达数十GB,在GPU、网络和存储间的频繁流转进一步加剧延迟。

针对通信瓶颈,中科曙光推出IBGDA技术,通过让GPU内核直接驱动网卡,将通信指令下发权从CPU转移至GPU,减少数据传输环节。在存储领域,该公司采用分层加速方案:NFS over RDMA处理训练数据和Checkpoint文件访问,NVMe over RDMA优化KV Cache块数据缓存,XDS技术实现GPU直连远端存储。这套组合使存储访问延迟降低超80%,有效缓解了"以存代算"的延迟问题。

GPUStack则从软件栈层面寻求突破,将推理后端设计为可插拔插件,支持新模型"即插即用"。其开源平台已积累11万部署实例,用户通过社区传播自然增长,国内某头部芯片企业甚至将90%业务迁移至该平台。CTO梁胜比喻称,当前行业状态类似上世纪90年代的Windows生态——驱动需要持续调试,兼容性问题频发。这种标准化努力旨在构建算力中心的"操作系统",屏蔽底层硬件差异。

产业实践印证了系统级创新的重要性。DeepSeek公开的跨硬件训练方案显示,其模型同时运行在英伟达和华为硬件上,证明通过优化集群规模和通信效率可弥补单卡性能差距。目前,国产GPU已形成上千卡集群,万卡集群建设正在推进。当硬件供给趋于充足,配套的软件管理体系将成为决定算力"可用性"的关键因素。

这场转型正在重塑中国AI产业格局。从单纯追求算力规模到注重系统效能,从硬件采购竞赛到全栈优化能力比拼,行业正经历从"可用"到"好用"的关键跨越。无论是GPUStack的软件标准化路径,还是中科曙光的硬件加速方案,都指向同一个方向:只有破解算力、网络、存储的协同难题,才能让AI基础设施真正成为推动产业升级的"自来水系统"。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version