AI算力效率的又一次跃升。7月22日,英伟达公布了一项基于Blackwell GB300平台的大规模MoE模型预训练测试结果:采用671B参数的DeepSeek-v3模型,在GB300集群上进行预训练时,单GPU有效算力达到1648 TFLOPs,创下MoE架构预训练效率的新纪录。

测试配置:万卡级集群,软硬协同优化

此次测试在英伟达内部AI实验室完成,使用由GB300 GPU构建的大规模集群。GB300是英伟达Blackwell架构的最新升级版本,相较B200在显存带宽、NVLink互连和散热设计上均有提升。

测试模型为DeepSeek-v3,总参数量671B,采用MoE架构。测试团队通过多项系统级优化——包括计算通信重叠、动态路由负载均衡、混合精度训练策略等——使得有效算力利用率达到接近峰值的水平。

在标准测试条件下,GB300单GPU理论峰值算力约2000-2300 TFLOPs,1648 TFLOPs有效算力意味着利用率超过70% 。在大规模分布式MoE训练中,这一利用率属于极高水准。作为参考,GPT-4级别的训练通常有效算力利用率为40%-50%。

MoE:高效但难以高效训练

MoE架构的优势在于推理——每次只激活一小部分专家,推理成本可控。但其训练过程却面临显著的通信瓶颈。

以DeepSeek-v3为例,总参数671B,但每次前向传播仅激活约37B参数。在训练时,token需要动态路由到特定专家。这一过程涉及大量all-to-all通信——每个token的专家选择结果需要跨GPU同步,专家参数的梯度也需要跨节点聚合。

MoE训练效率的瓶颈不在于计算,而在于通信。如果一个token被分配到分布在4个不同GPU上的4个专家,那这一层的激活值就需要跨4个GPU传输。随着专家数量的增加,跨节点通信的开销呈指数级上升。

1648 TFLOPs意味着什么?

在MoE架构下达到1648 TFLOPs有效算力,其价值不仅在于算力本身,更在于“算力利用率”的突破。

第一,对DeepSeek而言,证明了大模型训练不再依赖英伟达的顶级算力也能实现高效训练。 如果MoE模型的训练效率能够持续优化,小团队和学术机构也有望以更低的算力成本训练千亿级模型。

第二,对英伟达而言,在AMD和谷歌TPU持续追赶的背景下,GB300的测试数据证明了Blackwell架构在复杂分布式训练场景中的通信效率优势。 通过NVLink 5和NVSwitch 4等高速互连技术,MoE训练中的通信瓶颈得到了有效缓解,使有效算力利用率突破70%。

第三,进一步压缩了AMD的竞争空间。 在AMD MI450定制版推理芯片规格刚刚被曝“计算单元腰斩、显存仅剩三分之一”后,英伟达用GB300在训练效率上的压倒性优势向市场和客户证明——无论是训练还是推理,Blackwell仍然是综合效能最高的选择。

推理侧的效率同样值得关注

1648 TFLOPs的预训练效率刷新了MoE训练纪录,但DeepSeek-v3真正商业化的优势在于推理端的效率——MoE架构在推理时仅激活约37B参数,这使得671B模型能以接近37B模型的推理成本运行。这一特性使DeepSeek-v3成为企业级API服务的理想选择。

当训练效率不再成为瓶颈,推理成本将成为决定大模型商业化的关键变量。 DeepSeek-v3与Blackwell GB300的组合,在这条路上已经迈出了关键一步。