返回首頁

AI 基礎設施

NVIDIA ModelExpress 以 GPU 對 GPU 傳送權重,將 806 GiB 模型擴容時間壓至兩分鐘內

NVIDIA 公開 ModelExpress 的完整傳輸路徑,讓新推論副本優先透過 P2P RDMA 從既有 GPU 複製權重與編譯快取。官方在 8 張 B200 上把 DeepSeek-V4-Pro 的 API 就緒時間由 8 分鐘縮至 1 分 44 秒,但結果高度依賴同型 GPU、高速網路與相容的張量配置。

Joydeep · CC BY-SA 3.0 · Image source
zh-Hant

NVIDIA 7 月 24 日詳解 Dynamo 元件 ModelExpress(MX),試圖解決大型模型服務最棘手的擴容延遲:新工作者除了載入數百 GiB 權重,還要重做張量轉換、JIT 核心編譯、自動調校及 CUDA Graph 擷取。MX 的控制平面透過 Redis、Kubernetes CRD 或服務中繼資料尋找相容來源;資料平面則依序嘗試 P2P RDMA、ModelStreamer、GPUDirect Storage,最後才退回一般主機暫存 I/O。

若已有副本持有相同模型、量化格式、平行配置與張量布局,MX 會利用 NIXL 從來源 GPU 直接讀入目標 GPU。新副本完成後也加入來源池,形成隨副本數擴大的權重扇出,而非每台機器反覆向物件儲存下載。對共享磁碟情境,快取服務以原子宣告選出單一下載者;官方估算十個副本同時取得 806 GiB 模型,傳統做法會製造約 8 TiB 重複入口流量。

MX 也可傳送 Triton、DeepGEMM、TileLang、CuTe DSL 與 FlashInfer 的編譯產物。NVIDIA 在 8 張 B200、ConnectX-7、vLLM 0.23.0、TP=8 的單節點測試中,宣稱 DeepSeek-V4-Pro 的權重及核心快取傳輸低於十秒,總啟動時間由八分鐘降至一分四十四秒。VMM arena 還能把逐張量 RDMA 記憶體註冊合併成單一區域。

工程上值得關注的是,MX 把權重分發從儲存問題改成服務副本間的資料平面問題,也能延伸至 RL rollout 工作者主動拉取新版權重。不過首個工作者仍須冷載入,來源程序必須持續在線;TensorRT-LLM 的後轉換接收目前主要限於 Llama 家族。官方測試也未涵蓋跨區、混合 GPU、網路壅塞或大量並行擴容,導入前仍應以實際拓撲測量失敗回退與來源飽和情形。

來源

  1. ModelExpress: Distributing Model Artifacts at the Speed of Light
  2. ai-dynamo/modelexpress
  3. ModelExpress Checkpoint Loading