英伟达近日公布了一项基于SemiAnalysis AgentX工作负载的测试结果,其最新架构Vera Rubin在AI数据中心能效方面展现出显著优势。测试采用DeepSeek-v4-PRO 1.6T模型作为基准,数据显示Vera Rubin架构的每兆瓦吞吐量达到Blackwell架构的30倍,这一核心指标直接反映了单位电力下AI算力的产出效率。
每兆瓦吞吐量(Tokens per Megawatt)作为衡量AI数据中心能效的关键标准,其计算方式为固定电力消耗下产生的AI Token数量。SemiAnalysis AgentX工作负载通过四项核心指标评估智能体编程推理性能:端到端归一化交互性涵盖从请求提交到最终Token输出的完整周期;标准交互性聚焦首个Token生成后的处理效率;端到端延迟统计单次请求的总处理时间;首个Token延迟则单独计量初始响应速度。这些指标共同构成了评估AI系统实时交互能力的多维框架。
在具体硬件对比中,采用GB300 NVL72配置的Grace Blackwell服务器展现出代际飞跃。相较于H200 NVL8 Hopper方案,其每兆瓦吞吐量提升达15倍,同时将每百万Token生成成本压缩至上一代的十分之一。这种能效提升使得运营方在相同电力预算下可支持更多智能体运行,或通过降低运营成本维持现有服务规模。
Vera Rubin架构在此基础上的突破更为显著。测试数据显示,NVL72配置的Vera Rubin系统在DeepSeek V4 Pro模型上,每兆瓦吞吐量达到GB300 NVL72的30倍,每百万Token成本进一步降至后者的三十五分之一。这种指数级提升源于架构层面的多重优化,包括更高效的电力分配机制、优化的数据传输路径以及改进的并行计算能力。
从商业应用角度看,这种能效突破具有重要现实意义。对于需要持续运行大规模智能体的企业而言,Vera Rubin架构可显著降低电力消耗与运营成本。以处理百万级Token的工作负载为例,新架构可将电费支出压缩至原有方案的3%左右,同时维持相同的处理速度与服务质量。这种成本优势在需要24小时不间断运行的对话系统、实时数据分析等场景中尤为突出。
技术层面,Vera Rubin架构的突破反映了AI硬件发展的新趋势。通过将计算密度与能源效率进行深度优化,该架构证明了在摩尔定律放缓的背景下,通过系统级创新仍可实现性能指数级提升。这种发展路径可能为未来AI数据中心建设提供新范式,推动行业从单纯追求算力规模转向能效比优化。











