ITBear旗下自媒体矩阵:

云天励飞陈宁:推理时代开启新篇,2030年“百亿Token一分钱”有望成真

   时间:2026-07-19 13:44:17 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在近期举办的世界人工智能大会上,AI推理芯片的发展方向成为焦点议题。云天励飞董事长兼CEO陈宁在主题演讲中提出,随着AI进入大推理时代,传统以GPU为核心的算力模式已难以满足多样化需求,GPNPU架构将成为推动行业变革的关键技术。这一观点引发了业界对推理时代算力基础设施重构的广泛讨论。

陈宁指出,2012年至2025年可视为AI训练时代,模型与芯片的发展均围绕"规模扩张"展开。在此阶段,NPU与小模型协同发展,而具备超大规模并行计算能力的GPGPU则在大模型浪潮中占据主导地位。但推理场景与训练存在本质差异,其核心挑战在于需要同时支持海量异构模型、实现多场景覆盖,并在保证高吞吐量的同时控制成本。这种复杂性使得单一技术路线难以满足所有需求。

针对这一挑战,云天励飞提出了GPNPU解决方案。该架构通过融合NPU、GPGPU、近存计算及算力积木技术,在保持高性能与灵活性的基础上,重点优化了效率与时延指标,并为大规模算力扩展预留了技术接口。陈宁强调,推理时代的算力竞争已从单芯片性能转向Token生成效率,这需要芯片、集群与软件栈的协同创新。

在技术路线图方面,云天励飞计划推出三款云端大算力推理芯片:DeepVerse100P、100D和100L。这三款产品分别针对推理流程中的不同环节进行专项优化:100P聚焦百万级上下文Prefill场景,解决计算资源竞争问题;100D专注Decode环节,通过提升内存带宽降低通信延迟;100L则通过3D Memory架构优化FFN计算,适用于复杂长周期任务。三款芯片可组成异构集群,形成覆盖全推理流程的解决方案。

行业巨头的技术转型印证了这一趋势。英伟达最新量产的Vera Rubin架构首次集成了7颗不同类型芯片,其中包含来自推理芯片厂商Groq的LPU单元,旨在补齐推理性能短板。AMD也在探索系统集成路线,通过芯片协同提升整体效能。这些动向表明,推理时代的技术竞争已从单点突破转向系统级创新。

Token经济成为衡量AI落地成效的关键指标。当前行业面临双重困境:一方面,AI Coding和Agent应用的爆发式增长推高了推理需求;另一方面,算力供给增速滞后导致Token价格居高不下,甚至出现质量波动。这种供需失衡不仅制约商业化进程,还可能引发市场信任危机。陈宁认为,构建新型算力基础设施已成为行业刚需。

云天励飞提出的解决方案聚焦Token生成全流程优化。其推理集群通过动态资源分配机制,根据不同环节的负载特征配置芯片与计算资源,并利用高速互联技术实现系统级协同。这种设计将优化范围从单芯片扩展至计算、存储、通信、调度和软件等多个维度,旨在提升整体系统效率而非单一性能指标。

在成本控制方面,云天励飞联合产业链伙伴发起了"1001计划"。该计划设定了阶段性目标:两年内将百万Token成本从当前水平降至一分钱,最终在2030年实现百亿Token一分钱的长期愿景。陈宁特别强调,性价比提升不能以牺牲质量为代价,每个Token需要承载更强的智能与更高的实用价值。

实现这一目标需要全产业链协同。陈宁指出,国产AI在单点技术上已取得突破,但在生态建设层面仍存在三大瓶颈:重复适配导致的资源浪费、上下游反馈链路过长、缺乏规模化验证场景。为此,云天励飞将围绕DeepVerse系列芯片建设IFWA软件生态,并通过"1001计划"构建长期合作机制,推动芯片、系统、模型、应用等环节的共同演进。

当前AI发展正经历从训练到推理的范式转变,这一过程呈现出明显的阶段性特征:个性化需求催生专业化分工,而专业化分工又为规模化应用奠定基础。通过算力基础设施的重构与生态协同的深化,更高性价比的Token服务有望推动AI技术真正走向普惠化,使普通用户也能获得以往只有大型机构才能享有的智能能力。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version