NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐量最高达 GB300 NVL72 的 3.7x
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 中首次提交预览结果,在 Qwen3-VL 上的吞吐量最高达到 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上最高达到 2.5x。
推荐理由:文章将 Vera Rubin NVL72 的模型吞吐、GB300 NVL72 的跨机架扩展效率与软件优化增益放在同一组 MLPerf 结果中,便于比较推理基础设施的长期经济性。