在近期举办的中国算力大会“算力首创首发发布会”专场上,一款具有里程碑意义的国产算力系统正式亮相——由移动云公司携手中国电子科技南湖研究院、北京灵汐科技、上海天数智芯以及清华大学、北京大学等多方力量共同研发的国内首个国产GPU与类脑芯片大模型异构混合推理系统揭开面纱。这一成果标志着我国在AI推理算力领域迈出了自主可控的关键一步。
当前,人工智能产业正从模型训练向规模化推理服务加速转型,推理算力已成为支撑词元工厂、AI智能体、文生视频等新兴业务的核心基础设施。然而,传统单一GPU推理架构在应对大模型并发服务时面临双重挑战:数据频繁搬运导致的“内存墙”与“功耗墙”问题日益突出,同时国内先进芯片制程供给受限,单纯依赖硬件工艺升级提升算力的路径已接近天花板。行业迫切需要从系统架构层面寻找突破口。
研发团队另辟蹊径,首次将国产通用GPU与类脑芯片进行深度融合,构建起对标英伟达下一代国际先进水平的异构推理方案。该系统创新性地采用Transformer模型PD/AF分离推理模式:将Attention计算与FFN模块拆分,由不同特性的芯片分工处理——国产GPU负责承载Attention计算,类脑芯片则凭借其存算一体、片上大容量SRAM的架构优势,专门处理FFN模块。这一设计有效突破了传统GPU推理的固有瓶颈。
为确保两类算力高效协同,团队自主研发了模型编译器、高速互联协议和统一推理引擎,实现了任务拆解、调度与结果聚合的全流程优化。经DeepSeek V4 Flash大模型验证,该系统相较同类国产GPU算力集群,推理输出效率与能效均提升1倍以上,业务运营成本降低40%以上。这一成果证明,通过系统架构创新,依托国内成熟工艺的芯片完全能够实现对标国际下一代推理架构的性能指标。
该系统的诞生是产学研用协同创新的典范。项目整合了运营商、芯片企业、科研院所与高校的多方资源,构建起从底层芯片适配、推理引擎开发到业务场景验证的完整技术链条。目前,团队已规划面向词元工厂、AI代码开发、文生视频、多智能体协同、智能制造、金融通信安全等场景开展落地验证,并计划逐步开放核心异构推理框架,为国内GPU、类脑芯片厂商及算力运营商提供技术赋能,推动国产算力产业链整体升级。
此次异构混合推理系统的首发,为智能体时代的AI推理提供了国产化算力底座。其通过架构创新弥补工艺约束的思路,也为国内AI算力自主发展开辟了新的创新路径。











