天风国际证券分析师郭明錤在最新产业调研中披露,英伟达已重启针对大规模长上下文AI推理场景的Rubin CPX芯片项目,量产时间表确定为2027年第一季度。这款专为预填充阶段设计的GPU架构历经波折,从2025年GTC大会首次亮相到短暂搁置,最终通过重大技术革新重新进入开发轨道。
核心硬件配置方面,新版CPX采用168GB HBM4内存方案,相较于旧版128GB GDDR7实现容量跃升,虽然低于Rubin标准版的288GB配置,但通过NVFP4精度技术将单芯片算力维持在30-50 Petaflops区间。值得关注的是,英伟达维持了2300W的功耗设计,在性能密度与能效比之间取得平衡。
机柜系统迎来颠覆性改造,独立MGX ETL架构支持客户按64/128/192/256颗芯片进行弹性部署。每个运算单元包含8个运算托盘与1个交换机托盘,形成模块化设计。这种架构创新使数据中心可根据实际负载动态调整资源配置,特别适合处理波动性强的推理任务。
互联技术呈现差异化布局:托盘内部采用NVLink实现1-1.5TB/s带宽的Scale-Up连接,机柜内通过Spectrum-6以太网完成Scale-Out组网,跨机柜则依赖OSFP光纤构建高速通道。相较于Rubin的3.6TB/s统一带宽方案,CPX的混合架构在成本与性能间取得新平衡。
在协同工作模式上,英伟达构建了CPX与Vera Rubin NVL72的1:1配比方案。CPX专注处理输入文本的预填充与KV Cache构建,通过以太网RDMA将结构化数据传输至Rubin集群完成解码生成。这种分工模式使每个8芯片运算托盘配备的1.34TB HBM4内存,可覆盖90%以上长上下文场景需求。
据产业调研数据,当前AI推理任务中超过半数计算资源消耗在输入处理环节。CPX通过架构优化将该环节成本降低40%,同时保持与现有生态的兼容性。这种技术路线调整,反映出英伟达在应对生成式AI算力需求激增时的战略转向。











