AI 训练的算力军备竞赛再次刷新上限。6月16日,英伟达发布 MLPerf Training 6.0 基准测试成绩,Blackwell 平台在全部 7 项测试中拿下最快训练成绩,并成为唯一覆盖全部测试项目的硬件平台。更大的亮点在于规模——英伟达将训练集群推到 8192 块 GPU,在 DeepSeek-V3 671B 参数模型任务上创下迄今 MLPerf 史上最大规模纪录。
MLPerf 6.0:为什么它很重要?
MLPerf Training 是目前业界最权威的 AI 训练基准测试体系,由非营利机构 MLCommons 维护,用来横向比较不同硬件、软件系统在模型训练任务中的速度和效率。测试结果被各大云厂商、芯片企业和研究机构广泛参考,堪称 AI 算力的"奥运会"。
MLPerf Training 6.0 测试套件包含 7 项核心测试,涵盖当前主流大模型和机器学习工作负载:
- DeepSeek-V3:6710 亿参数 MoE 大语言模型,测试稀疏计算性能
- GPT-OSS 20B:210 亿参数生成式预训练语言模型
- Llama 3.1-8B:主流 80 亿参数 LLM 预训练
- Llama 2-70B:700 亿参数模型 LoRA 微调
- FLUX.1:文生图模型多节点扩展测试
- GNN(图神经网络):大规模图结构数据分类
- 推荐系统:基于 DLRM 的内容分发与广告推荐性能
值得注意的是,MLPerf 6.0 新增了 DeepSeek-V3 671B 和 GPT-OSS-20B 两个混合专家模型(MoE)预训练工作负载,这是该测试套件首次将 MoE 架构纳入大规模基准测试。
Blackwell 系统:8192 块 GPU 的算力怪兽
英伟达此次提交了 GB200 NVL72 和 GB300 NVL72 两套机架级系统参赛。每套 NVL72 内部通过第 5 代 NVLink Switch,将 72 块 GPU 的算力和内存整合成统一资源池,实现超高速的节点间通信。
在性能层面,GB300 NVL72 较 GB200 NVL72 在同等规模下最高可带来 1.6 倍训练速度提升——这意味着不到一年时间,Blackwell 系列的代际提升就接近翻倍。
在规模层面,英伟达将 Blackwell 训练集群推到 8192 块 GPU,在 DeepSeek-V3 671B 任务上提交了史上最大规模的 Blackwell 成绩单。
2.02 分钟:CoreWeave 创下的极端效率
MLPerf 6.0 还出现了另一位狠角色——云服务商 CoreWeave。它采用搭载 Spectrum-X 以太网的 GB300 NVL72 系统,在 8192 块 GPU 规模上将 DeepSeek-V3 671B 训练到目标质量,耗时仅 2.02 分钟。
2.02 分钟完成一个 6710 亿参数大模型的训练——这个数字即便放在几年前,也是不可想象的。这背后是软硬件协同优化的结果:Blackwell 架构的 GB300 芯片、更高效的 NVLink 互联、以及 Spectrum-X 网络的带宽支撑,缺一不可。
竞争格局:AMD 缺席,Intel 成绩如何?
从 MLPerf 6.0 的参赛名单来看,AMD 的存在感持续下降——多家主要云厂商已悄然将 AMD GPU 集群从 MLPerf 测试提交中撤出,转向英伟达 Blackwell 生态。
而英特尔的成绩相对平淡。尽管英特尔近年来在 AI 芯片领域持续发力,但其 Gaudi 系列在 MLPerf 基准测试中的表现与英伟达仍有明显差距。AMD 和英特尔能否在下一代架构中缩小差距,值得持续关注。
算力竞赛的下一步
MLPerf 6.0 的成绩揭示了几个趋势:
第一,大规模集群是标配。 8192 块 GPU 的训练规模意味着,AI 训练已进入"万卡时代"的门槛争夺战。未来超大规模集群的通信瓶颈(GPU 间互联带宽、内存带宽)将成为硬件竞争的焦点。
第二,MoE 架构成为测试主流。 DeepSeek-V3 作为 MoE 架构的代表进入 MLPerf 测试,意味着稀疏计算能力已与稠密模型同等重要。硬件厂商需要同时优化两类工作负载。
第三,2 分钟训练大模型将成常态。 随着硬件迭代加速和软件优化深入,未来"分钟级"完成大模型训练可能不再是极端案例,而是大厂的普遍基准。
写在最后
MLPerf 6.0 的成绩,是英伟达 Blackwell 平台的一次全面亮相,也是 AI 算力竞赛现状的一面镜子。从 8192 块 GPU 的集群规模,到 2.02 分钟的极端效率,再到 1.6 倍的代际性能提升,这些数字拼凑出的结论很清楚:在 AGI 的赛跑中,算力依然是决定胜负的核心变量。