大模型推理的能效纪录正在被快速刷新。最新披露的测试数据显示,英伟达下一代数据中心平台Vera Rubin NVL72在运行DeepSeek R1推理模型时,每兆瓦(MW)功耗的Token吞吐量达到了当前H100平台的10倍。

一、测试背景:DeepSeek R1推理模型

DeepSeek R1是深度求索公司于2026年初推出的推理增强大模型。与普通大语言模型不同,R1系列通过强化学习在数学、编程和逻辑推理任务上进行了专项优化。在AIME 2026、MATH-500等推理基准测试中,R1的表现可与GPT-5级别模型比肩,但推理阶段的算力消耗更高。

R1模型总参数规模约671B,采用MoE架构,每次推理激活约37B参数。其推理过程需要多次“思考”迭代,对显存带宽和计算能力的消耗显著高于普通对话模型。

二、硬件平台:Vera Rubin NVL72 vs H100

测试对比的两个平台代表了英伟达两代数据中心技术:

H100平台:当前AI训练与推理的主流标准,配备H100 GPU(80GB HBM3)、NVLink 3.0互联,单节点算力约4 petaFLOPS(FP8)

Vera Rubin NVL72:英伟达2027年规划平台,以Grace CPU+Rubin GPU为核心,配备NVLink 6.0互联和HBM4e显存,单GPU算力预计为H100的数倍

三、10倍提升从何而来?三大驱动因素

测试数据中最引人注目的数字是:在运行DeepSeek R1推理任务时,Vera Rubin NVL72每兆瓦功耗的Token吞吐量是H100平台的约10倍。这一提升由三个层面驱动:

1. 单芯片算力跃升。 Rubin GPU的FP8/FP4推理算力预计约为H100的3-4倍,得益于更先进的制程(预计N2P节点)和新一代Tensor Core架构。更大的算力意味着每秒可处理的Token数更多。

2. 显存带宽与容量大幅扩展。 H100的HBM3带宽约3.35TB/s,而Rubin的HBM4e预计带宽可达8-10TB/s,提升约2.5-3倍。搭配更高效的内存压缩技术与更大的L2缓存,可显著缩短KV Cache的访问延迟。

3. 系统级能效优化。 10倍的每兆瓦吞吐量提升意味着在同等功耗下可处理约10倍的Token量,或处理同等Token量仅需约十分之一的功耗。这除了来自芯片本身的能效改进,还涉及平台级优化——更高效的互联架构、更精细的功耗管理、以及针对MoE模型路由优化的系统软件层。

四、行业意义:推理成本的结构性下探

Vera Rubin NVL72在DeepSeek R1上的测试结果,验证了两个判断:

推理优化正在成为算力竞争的新焦点。 当训练算力竞赛接近阶段性天花板,推理效率将成为AI基础设施下一阶段的核心指标。

MoE架构与下一代硬件的适配将带来指数级能效提升。 DeepSeek R1作为MoE模型的代表,在Vera Rubin上展现出的效率提升意味着:大规模MoE模型的推理成本有望在下一次硬件迭代中大幅下降。

结语

10倍的每兆瓦Token吞吐量提升,不仅是硬件性能的胜利,也预示着大模型推理成本下一次结构性下降的可能性。当同等功耗可以处理10倍的请求量,AI应用的商业模型将迎来新的计算空间。