AI 基礎設施
NVIDIA DSX MaxLPS 動態調配機櫃功率,GB200 每瓦推論效能提高 1.5 倍
DSX MaxLPS 以即時遙測重新分配閒置功率,NVIDIA 測得 GB200 NVL72 機櫃的配置功率可由 125 kW 降至 90 kW而維持吞吐量。方案還結合工作負載功率設定與 45°C 液冷,但核心 Dynamic Power Software 仍處於 Developer Preview。

NVIDIA 進一步披露 DSX MaxLPS 的運作方式:不再按每座 GPU 機櫃的理論峰值永久預留電力,而是由 Dynamic Power Software(DPS)建立從供電設施、資源群組、機櫃、節點到 GPU 的拓撲,持續讀取實際功耗,再於管理員設定的預算及政策內轉移未用完的功率額度。控制迴圈會更新 GPU 功率上限、驗證群組是否仍符合總預算,並以 best-effort 方式處理維護或緊急降載事件。
在 NVIDIA 公布的代表性推論測試中,GB200 NVL72 執行 FP4 Kimi-K2.5 時,MaxLPS 把配置機櫃功率由 125 kW 降至 90 kW;若設施總功率不變,理論上可多容納 39% 機櫃,每瓦效能約提高 1.5 倍。另一組 DeepSeek-R1 FP4 測試由 136 kW 降至 101 kW,可增加約 35% 機櫃,每瓦效能提高 1.3 至 1.4 倍。這不是單靠降頻:APPM 會按推論、訓練、記憶體受限或運算受限工作套用預先驗證的功率設定,Dynamo 則可進一步調整跨機櫃推論拓撲。
MaxLPS 同時要求設施端配合。Vera Rubin NVL72 的設計目標包括 45°C 冷卻液入口,讓合適氣候下的資料中心減少壓縮式冷水機使用,把冷卻電力轉給運算。DSX Exchange 可透過 NATS 事件匯流排連接 DPS、建築管理、電力、冷卻與排程器,但並非 MaxLPS 的必要元件。
工程團隊不應直接把「多 40% GPU」套進容量預算。這些數字來自 NVIDIA 選定的模型、精度、吞吐目標及自家平台,尚欠第三方跨模型重現;公開圖文對第二套測試平台的 Vera Rubin/GB300 標示亦不完全一致。DPS 仍只向核准的早期預覽客戶開放,而且實際收益取決於延遲、錯誤率、峰值功耗、冗餘策略及場地冷卻條件。較可靠的採用方式,是以相同服務級別比較靜態配置與 DPS 管理結果,再決定是否擴充機櫃密度。