AI 前沿 2026 年 9 月 17 日

2026-09-17 — Vera Rubin首測:推論輸出比GB300快最高3.7倍

primary=https://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/

Vera Rubin首測:推論輸出比GB300快最高3.7倍

NVIDIA Blog · 2026-09-16

Vera Rubin NVL72Qwen3-VL推論情境下的吞吐量,最高比上一代GB300 NVL72快3.7倍,在大型MoE推理模型DeepSeek-R1上快最高2.5倍,在SemiAnalysis設計的agentic基準AgentX上差距則被拉開到30倍。這是NVIDIA首次讓次世代平台以preview身分參與MLPerf Inference v6.1送測,對照組是目前出貨中的GB300 NVL72

背景:agentic與大型MoE推論的新負擔

MLPerf Inference是MLCommons主導的推論效能基準測試,這次公布的是v6.1版本成績,其中DeepSeek-R1Qwen3-VL是正式送測項目,AgentX則是SemiAnalysis設計、用來衡量agentic工作負載的基準。原文指出,AI agent需要跨越多個步驟進行推理、規劃與行動,這類負載對推論系統的要求,和傳統一問一答式的單輪推論明顯不同。

這種轉變加重了兩類負擔:一是像DeepSeek-R1這樣的大型MoE推理模型,需要在眾多expert之間做大規模parallelism,對互連頻寬與記憶體容量要求更高;二是agentic場景需要反覆生成、規劃與呼叫工具,decode階段的步驟數與KV cache用量都遠高於單輪問答。GB300 NVL72並非原地踏步,NVIDIA說明,光靠降低KV cache精度、增加kernel fusion與更好的kernel,加上導入disaggregated serving,GB300 NVL72從v6.0升到v6.1就已拿到最高1.6倍的軟體優化,但即便如此,面對agentic與大型MoE推理,仍留下讓Vera Rubin NVL72能拉開2.5倍到30倍差距的空間。

三個工作負載的實測數字與技術手段

NVIDIA這次只在MLPerf Inference v6.1提交兩個基準的Vera Rubin NVL72 preview成績:Qwen3-VLDeepSeek-R1Qwen3-VL這邊,Vera Rubin NVL72搭配vLLMNVIDIA Dynamo,在offline、server、interactive三種情境下的吞吐量都領先GB300 NVL72,最高達3.7倍;DeepSeek-R1則改用TensorRT-LLM,最高快2.5倍。AgentX的30倍差距,是NVIDIA另外用SemiAnalysis設計的agentic基準做的preview測試,並未列在正式送測的兩個MLPerf項目裡。

基準測試工作負載類型軟體堆疊Vera Rubin NVL72相對GB300 NVL72
Qwen3-VL多模態視覺語言推論(offline/server/interactive)vLLM + NVIDIA Dynamo最高3.7倍吞吐量
DeepSeek-R1大型MoE推理模型TensorRT-LLM最高2.5倍吞吐量
AgentX(SemiAnalysis)Agentic多步驟推理/規劃/行動NVIDIA內部preview測試最高30倍效能

這些差距背後的共通技術,是量化精度與disaggregated serving的組合。Vera Rubin導入NVFP4精度,把模型權重、注意力與KV cache的記憶體用量一併壓低,讓吞吐量提升但輸出品質幾乎不受影響;同時強化過的Tensor Core與Transformer Engine同時加速prefill與decode兩個階段。在服務架構上,Vera Rubin的送測大量採用disaggregated serving,把prefill與decode拆開處理,並針對DeepSeek-R1這類MoE模型做大規模expert parallelism,藉此提升整體效率。

這些數字對誰有影響、該怎麼解讀

對正在評估下一代推論叢集的容量規劃或採購團隊來說,這批數字目前只能當方向性參考。三組對比中,只有Qwen3-VLDeepSeek-R1是正式送到MLPerf Inference v6.1、由MLCommons公布在mlcommons.org上的preview成績;AgentX的30倍則是NVIDIA自行用SemiAnalysis的基準做的測試,沒有經過MLCommons的送測與稽核流程。

即使是正式送測的兩項,Vera Rubin NVL72的身分也是preview,代表這是尚未大量出貨的次世代平台在受控環境下取得的先行結果,跟GB300 NVL72作為目前量產、大規模部署平台的成績並不是完全對等的比較基準。把這些倍數換算到自己實際的部署規模之前,需要先把「preview對比量產」這層落差、以及AgentX未經第三方稽核這兩點納入考量。

原始來源:NVIDIA Blog


End of article
0
Would love your thoughts, please comment.x
()
x