返回首頁

資料中心基礎設施

NVIDIA Spectrum-6 將單晶片乙太網路交換容量推至 102.4 Tbps

NVIDIA 開始部署為 Vera Rubin 平台設計的 Spectrum-6 交換系統,單晶片提供 102.4 Tbps 吞吐量。產品同時導入 800Gb/s 連接埠、液冷與共封裝光學選項,瞄準十萬張以上 GPU 的橫向擴充網路。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

NVIDIA 公布 Spectrum-6 已進入大型 AI 資料中心部署階段。核心交換晶片提供 102.4 Tbps 吞吐量,是上一代系統容量的兩倍,並與 ConnectX-9 SuperNIC、BlueField-4 DPU、Vera CPU、Rubin GPU及 NVLink 6 共同構成 Vera Rubin 平台。它處理的不是機架內 GPU 互連,而是跨伺服器與跨機架的 scale-out 流量。

AI 訓練與分散式推論會頻繁執行 all-reduce、all-to-all 等集合通訊;大量節點同時傳送資料時,傳統為南北向企業流量設計的乙太網路容易出現壅塞、尾端延遲與路徑失衡。Spectrum-X 軟硬體堆疊會在多條路徑間調節流量、繞過故障並執行精確重傳。NVIDIA 宣稱,相較一般乙太網路,其 AI 網路效能最高可提升 1.6 倍,且在超過十萬張 GPU 的部署維持最高 95% 網路效率;這些數值目前仍屬供應商測試結果。

公開硬體手冊顯示,SN6600 與液冷版 SN6600-LD 均提供 128 個 800Gb/s OSFP 埠及 256MB 封包緩衝。液冷 SN6600-LD 典型功耗依光學模組配置約為 2.79至3.3kW;更大型的 SN6800-LD 以四顆 Spectrum-6 ASIC 提供 409.6 Tbps,典型功耗達 8.3kW。產品支援可插拔或共封裝光學,反映交換容量上升後,光學 I/O、散熱與供電已成為同等重要的系統限制。

網路工程師接下來應關注實際集合通訊完成時間、故障復原期間的尾延遲、不同 RDMA 傳輸模式的互通性,以及共封裝光學的維修成本。Spectrum-6 支援標準乙太網路與開放網路作業系統,但最佳效能依賴 NVIDIA 網卡、交換晶片和軟體的協同設計;採購者仍需評估這種整合帶來的效能收益,是否抵得過供應商綁定與功耗密度。

來源

  1. Built for Vera Rubin, NVIDIA Spectrum-6 Arrives in Gigascale AI Factories
  2. Nvidia outlines plans for using light for communication between AI GPUs by 2026
  3. Spectrum-6 SN6000 Switch Systems Hardware User Manual: Specifications
  4. Behind the Scenes at NVIDIA's Engineering SuperLab