OmniTools 9月16日消息,英伟达官方 9 月 16 日消息,英伟达 Vera Rubin NVL72 系统在 MLPerf Inference v6.1 基准测试中首次提交预览结果。该系统在 Qwen3-VL 和 DeepSeek-R1 两项高负载推理任务中,分别实现最高 3.7 倍和 2.5 倍于 GB300 NVL72 的吞吐量。
同期公布的 GB300 NVL72 四机架(288 GPU)配置在 DeepSeek-R1 离线场景中达到 99% 扩展效率,吞吐量近乎线性增长。软件优化方面,v6.1 版本相较 v6.0 在 Qwen3-VL 上性能提升最高达 1.6 倍。
Vera Rubin NVL72 采用增强型 Tensor Core 与 Transformer Engine,支持 NVFP4 精度以降低模型权重及 KV 缓存内存占用,并依托第六代 NVLink 互连技术实现低延迟、高带宽机架级通信。Nebius 等合作伙伴亦提交了基于该平台的预览测试结果。