跳到正文
每日版 · AI 行业记录本期 2026年9月21日星期一
实时更新 ●
研究综合报道2 分钟阅读作者:AI Tools Daily

英伟达 Vera Rubin NVL72 首战 MLPerf Inference v6.1:Qwen3-VL 吞吐最高达 GB300 NVL72 的 3.7 倍

9 月 16 日 MLPerf Inference v6.1 发布,Vera Rubin NVL72 首次以预览成绩参赛,在 Qwen3-VL 上吞吐最高 3.7 倍于 GB300 NVL72;GB300 四机架扩展效率达 99%。

分享XLinkedIn

2026 年 9 月 16 日,MLPerf Inference v6.1 成绩发布。NVIDIA 官方博客称,Vera Rubin NVL72 在首次 MLPerf Inference 预览提交中交出领先成绩:在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍。所有结果均属 MLPerf Inference v6.1 闭源组(Closed Division),官方注明数据于 9 月 16 日取自 www.mlcommons.org。

首次提交的具体条件

NVIDIA 在 v6.1 套件中两个“要求最高”的基准上提交预览成绩,并区分了软件栈:

  • Qwen3-VL:使用 vLLM 搭配 NVIDIA Dynamo 开源推理框架,在离线、服务器与交互三种场景下吞吐最高 3.7 倍于 GB300 NVL72。
  • DeepSeek-R1:使用 NVIDIA TensorRT-LLM 库,吞吐最高 2.5 倍于 GB300 NVL72。
  • 官方对应的条目编号为 6.1-0106 与 6.1-0074;合作伙伴 Nebius 也提交了 Vera Rubin NVL72 的预览结果。

效率与规模的另一组数字

  • GB300 NVL72 的 288 GPU 提交(四个机架)在离线场景实现 99% 的扩展效率,吞吐接近随硬件线性增长(DeepSeek-R1,条目 6.1-0073 与 6.1-0074)。
  • 在 WAN 2.2 文本生成视频基准上,GB300 NVL72 达到每秒 0.65 段 720p 视频、每段 5.7 秒,相对单节点吞吐高 9 倍、延迟低 7.5 倍。
  • 软件层面,v6.1 中 GB300 NVL72 在 Qwen3-VL 上较 v6.0 提升最高 1.6 倍,来源包括更低的 KV cache 精度、更多算子融合、更好的 kernel,以及基于 vLLM 与 Dynamo 的分离式服务(disaggregated serving)。
  • 在非 MLPerf 的 SemiAnalysis AgentX 预览测试中,Vera Rubin NVL72 的表现 30 倍于 GB300 NVL72;官方同时预告即将推出的 MLPerf Endpoints 基准将为智能体式推理提供标准化度量。

为什么这些差距会出现

NVIDIA 把成绩归因于硬件与软件的全栈协同设计:Vera Rubin 增强的 Tensor Core 与 Transformer Engine 同时加速推理的 prefill 与 decode 阶段,NVFP4 精度在模型权重、注意力与 KV cache 上降低显存占用;提交大量使用分离式服务,并为 DeepSeek-R1、Qwen3-VL 这类 MoE 模型的大规模专家并行做了优化。互连方面,NVL72 的 scale-up 域由第六代 NVLink 与 NVLink Switch 支撑,官方称其数据包速率比现成以太网高 10 倍、延迟低 3 倍。

边界与读法

需要注意三点:Vera Rubin 的成绩在官方表述中均为“预览提交”,且官方强调这些是早期结果;v6.1 之后继续做的软件优化(在 GPT-OSS-120B 与 DLRMv3 上的进一步增益)尚未经 MLCommons 验证;30 倍的智能体基准数字来自 SemiAnalysis 的测试而非 MLPerf。此外 NVIDIA 还提交了 Jetson AGX Thor 在新设的 Edge-Agentic 基准(Qwen3.6-27B)上的结果,并称有 19 家合作伙伴参与本轮、其中 8 家使用多节点 Blackwell NVL72 系统。

本文综合自官方公告及公开报道,原始来源见文末链接。

来源:NVIDIA

AI Tools Daily 是中英双语新闻室,追踪 AI 工具发布、产品更新与行业趋势。 编辑准则 · 提交更正

本栏目全部报道 · 研究