在近期举办的世界人工智能大会上,AI推理芯片的发展方向成为焦点议题。云天励飞董事长兼CEO陈宁在主题演讲中提出,随着AI进入大推理时代,传统以GPU为核心的算力模式已难以满足多样化需求,GPNPU架构将成为推动行业变革的关键技术。这一观点引发了业界对推理时代算力基础设施重构的广泛讨论。
陈宁指出,2012年至2025年可视为AI训练时代,模型与芯片的发展均围绕"规模扩张"展开。在此阶段,NPU与小模型协同发展,而具备超大规模并行计算能力的GPGPU则在大模型浪潮中占据主导地位。但推理场景与训练存在本质差异,其核心挑战在于需要同时支持海量异构模型、实现多场景覆盖,并在保证高吞吐量的同时控制成本。这种复杂性使得单一技术路线难以满足所有需求。
针对这一挑战,云天励飞提出了GPNPU解决方案。该架构通过融合NPU、GPGPU、近存计算及算力积木技术,在保持高性能与灵活性的基础上,重点优化了效率与时延指标,并为大规模算力扩展预留了技术接口。陈宁强调,推理时代的算力竞争已从单芯片性能转向Token生成效率,这需要芯片、集群与软件栈的协同创新。
在技术路线图方面,云天励飞计划推出三款云端大算力推理芯片:DeepVerse100P、100D和100L。这三款产品分别针对推理流程中的不同环节进行专项优化:100P聚焦百万级上下文Prefill场景,解决计算资源竞争问题;100D专注Decode环节,通过提升内存带宽降低通信延迟;100L则通过3D Memory架构优化FFN计算,适用于复杂长周期任务。三款芯片可组成异构集群,形成覆盖全推理流程的解决方案。
行业巨头的技术转型印证了这一趋势。英伟达最新量产的Vera Rubin架构首次集成了7颗不同类型芯片,其中包含来自推理芯片厂商Groq的LPU单元,旨在补齐推理性能短板。AMD也在探索系统集成路线,通过芯片协同提升整体效能。这些动向表明,推理时代的技术竞争已从单点突破转向系统级创新。
Token经济成为衡量AI落地成效的关键指标。当前行业面临双重困境:一方面,AI Coding和Agent应用的爆发式增长推高了推理需求;另一方面,算力供给增速滞后导致Token价格居高不下,甚至出现质量波动。这种供需失衡不仅制约商业化进程,还可能引发市场信任危机。陈宁认为,构建新型算力基础设施已成为行业刚需。
云天励飞提出的解决方案聚焦Token生成全流程优化。其推理集群通过动态资源分配机制,根据不同环节的负载特征配置芯片与计算资源,并利用高速互联技术实现系统级协同。这种设计将优化范围从单芯片扩展至计算、存储、通信、调度和软件等多个维度,旨在提升整体系统效率而非单一性能指标。
在成本控制方面,云天励飞联合产业链伙伴发起了"1001计划"。该计划设定了阶段性目标:两年内将百万Token成本从当前水平降至一分钱,最终在2030年实现百亿Token一分钱的长期愿景。陈宁特别强调,性价比提升不能以牺牲质量为代价,每个Token需要承载更强的智能与更高的实用价值。
实现这一目标需要全产业链协同。陈宁指出,国产AI在单点技术上已取得突破,但在生态建设层面仍存在三大瓶颈:重复适配导致的资源浪费、上下游反馈链路过长、缺乏规模化验证场景。为此,云天励飞将围绕DeepVerse系列芯片建设IFWA软件生态,并通过"1001计划"构建长期合作机制,推动芯片、系统、模型、应用等环节的共同演进。
当前AI发展正经历从训练到推理的范式转变,这一过程呈现出明显的阶段性特征:个性化需求催生专业化分工,而专业化分工又为规模化应用奠定基础。通过算力基础设施的重构与生态协同的深化,更高性价比的Token服务有望推动AI技术真正走向普惠化,使普通用户也能获得以往只有大型机构才能享有的智能能力。











