返回首頁

AI infrastructure

Rubin NVL72 首輪 AgentX 實測公開,最高每瓦 token 增益仍取決於比較基線

SemiAnalysis 在預發布軟體上測試 Vera Rubin NVL72,報告相較 Blackwell 最高約七倍的每兆瓦 token 吞吐量。結果凸顯 HBM4 與 NVLink 6 對長上下文、MoE 推論的作用,但 67 倍性價比標題包含租賃價格及特定操作點假設。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

SemiAnalysis 9 月 14 日發布 Vera Rubin NVL72 的首批 AgentX 結果,稱在其長上下文、多輪 coding-agent 工作負載上,預發布 Rubin 軟硬體相較 Blackwell 可達最高約七倍的每兆瓦 token 吞吐量;若加入其雲端租賃價格調查與特定延遲操作點,個別比較的每美元效能差距最高被放大至 67 倍。後一數字不是跨工作負載的固定硬體倍數,也不宜直接套進採購模型。

AgentX 不只量離線總吞吐量,而是以每位使用者 token 速度、首 token 延遲及多輪長上下文請求形成效能曲線。這比單一 batch 的 tokens/s 更接近代理服務,因為 coding agent 會反覆提交長提示、工具結果與短輸出;同一系統在高併發時若首 token 延遲急升,總吞吐量再高也未必可用。

硬體設計解釋了部分增益。NVIDIA 的正式規格顯示,一櫃 NVL72 整合 72 顆 Rubin GPU、36 顆 Vera CPU、20.7 TB HBM4,總記憶體頻寬最高約 1.58 PB/s,NVLink 6 則為每顆 GPU 提供 3.6 TB/s scale-up 頻寬。對大型 MoE 而言,專家權重讀取、KV cache 與 all-to-all 通訊往往比純算力更早受限;把整櫃視為單一 72-GPU 執行域,可減少跨節點通訊及記憶體壓力。

不過目前軟體仍屬早期版本,基線結果也可能使用不同時間點的 SGLang、TensorRT-LLM、量化與並行配置。SemiAnalysis 的美元指標還依賴自有三年期租賃價格調查;token/瓦也沒有衡量答案品質或完成任務所需 token。工程團隊應等待公開工作流的原始延遲、功率與命令列紀錄,並比較相同模型、精度、上下文及服務品質下的結果;AMD MI455X、Google TPU 與 Rubin 正式軟體加入同一測試後,領先幅度才更具採購意義。

來源

  1. Vera Rubin NVL72 Agentic Inference: 67x better Performance per Dollar
  2. Inside NVIDIA Rubin GPU Architecture: Powering the Era of Agentic AI
  3. DGX Vera Rubin NVL72 specifications