NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中展现领先性能
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览结果,其吞吐量比 GB300 NVL72 高出最多 3.7 倍。同时,GB300 NVL72 在 288 GPU 规模下实现了 99% 的扩展效率。软件优化持续带来性能提升,较 v6.0 最高提升 1.6 倍。
NVIDIA 在今日公布的 MLPerf Inference v6.1 结果中,首次提交了 Vera Rubin NVL72 系统的预览性能数据。在 DeepSeek-R1 和 Qwen3-VL 两个基准测试中,Vera Rubin NVL72 展现了领先的吞吐量表现。
具体来看,在 Qwen3-VL 测试中,Vera Rubin NVL72 的吞吐量比 GB300 NVL72 高出最多 3.7 倍,这得益于 vLLM 与 NVIDIA Dynamo 开源推理框架的结合使用。在 DeepSeek-R1 测试中,使用 NVIDIA TensorRT-LLM 库时,吞吐量比 GB300 NVL72 高最多 2.5 倍。这些早期结果显示了 NVIDIA 的快速创新步伐,并预计随着软件优化持续进步。
另一方面,NVIDIA GB300 NVL72 在扩展效率方面表现出色。一项涉及四个机架、共 288 GPU 的 DeepSeek-R1 提交实现了 99% 的扩展效率,吞吐量几乎随硬件增加呈线性增长。此外,GB300 NVL72 在 WAN 2.2 文生视频基准测试中,达到每秒 0.65 个 720p 视频的生成速度,比单节点提升 9 倍吞吐量和 7.5 倍延迟降低。
NVIDIA 还强调,其平台在软件优化上持续投入。在 MLPerf Inference v6.1 提交中的软件优化,较 v6.0 实现了最高 1.6 倍的性能提升,且提交后继续有性能改进。Vera Rubin 的增强 Tensor Cores 和 Transformer Engine 加速了推理的预填充和解码阶段,而 NVFP4 精度降低了模型权重、注意力和 KV 缓存的内存占用。此外,Vera Rubin 广泛使用了分离式服务,结合大规模专家并行,以提高混合专家模型层的效率。Nebius 也提交了 Vera Rubin NVL72 的预览结果,并展示了出色性能。
原文出处
NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debutblogs.nvidia.com
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。