在世界人工智能大会上,一家国内GPU企业公布了其AI发展蓝图,涵盖三大AI工厂、两款AI原生终端及一个完整的MUSA生态体系,展示了从算力基础设施到智能应用落地的全链条布局。
该企业推出的三大AI工厂均基于自主研发的夸娥智算集群构建。其中模型训练工厂聚焦大模型高效训练,已实现单集群万卡级算力,在稠密大模型训练中算力利用率达60%,有效训练时间占比超90%。通过特色优化技术,该集群将某1T参数大模型的预训练性能提升近一倍,并成功支撑全球首个5D世界模型的完整训练,该模型在斯坦福权威榜单连续37天位居榜首。
词元生产工厂针对推理环节的算力成本挑战,创新推出PD异构分离方案。通过将高算力需求的Prefill计算与高带宽的Decode生成分离部署,在保持1M超长上下文支持的同时,将3台国产卡与2台国际主流卡的组合效能提升至等效9台国际主流卡水平。该方案已支持多个国产前沿模型运行,在智能驾驶仿真场景中,单卡推理性能达到国际高端产品的64.3%。
智能体生产工厂着重解决端侧部署难题,推出的32GB内存AI算力本可流畅运行80B参数大模型。该设备通过自适应缓存管理机制,实现智能体内存数据的集中调度,支持12个智能体并行工作。同步展示的家庭AI中枢设备则整合了智能体管理、4K视频处理及3D游戏功能,配备全闪存高速存储并支持免拆机扩容。
在硬件创新方面,企业首次展出的MTT C256超节点采用一层Scale-up网络设计,在标准机柜中实现128卡全互联,扩展后可达256卡极速互联。这种高密计算交换一体化设计使GPU部署密度显著提升,为构建十万卡级超大规模集群提供了基础架构支持。
生态建设方面,企业构建了完整的MUSA技术栈。其自研代码大模型在国产算力底座上完成全链路训练,相关编程智能体可支持自然语言指令的代码生成与调试。开发者平台已聚集超45万用户,与全国200余所高校开展技术合作,推动MUSA架构在工业质检、智能驾驶等领域的深度应用。
该企业展示的全功能GPU具备AI计算、3D渲染、物理仿真和视频编解码四大引擎,这种"算渲仿"一体化能力使其成为国内少数同时覆盖B端和C端市场的厂商。通过云端万卡集群、边缘高性能模组及终端智能设备的协同布局,形成了覆盖"云-边-端"的全场景智算解决方案。













