返回首頁

AI 推論基礎設施

NVIDIA Dynamo 以共用 HBM 權重預熱備援引擎,故障切換由 283 秒縮至 7.3 秒

Dynamo 的實驗性 Shadow Engine Failover 讓兩個推論程序映射同一份 GPU 權重,避免程序崩潰後重新載入模型。NVIDIA 的 GLM-5.2 測試顯示恢復時間縮短近 39 倍,但目前主要支援 vLLM,亦無法處理 GPU、節點或跨節點故障。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

NVIDIA 為開源推論框架 Dynamo 加入實驗性的 Shadow Engine Failover,針對「推論程序死亡、GPU 與節點仍健康」的故障縮短服務降載時間。傳統冷啟動會隨 CUDA context 一併釋放 HBM 權重,替代程序因而要重新載入模型、配置 KV cache、自動調校並擷取 CUDA Graph;大型模型可能花上數分鐘。

新設計在每張 GPU 旁運行 GPU Memory Service(GMS),由獨立 sidecar 持有實體記憶體頁面。主引擎與預先初始化的 shadow engine 透過 CUDA Virtual Memory Management API,把同一份唯讀權重映射至各自的虛擬位址,因此備援程序毋須複製整套權重。Shadow 會預先建立 CUDA context、NCCL/NIXL 通訊器及 CUDA Graph,閒置時則釋放實體 KV cache;主程序退出後,核心釋放 POSIX `flock`,備援取得鎖、重新映射權重並建立 KV cache,再向路由器註冊。

NVIDIA 在兩個 B200 節點上部署 NVFP4 量化的 GLM-5.2,每節點使用八路 tensor parallel、200K 最大上下文與 FP8 KV cache,再以 `SIGKILL` 終止其中一個 worker。第二個 worker 以冷啟動恢復需 283 秒,shadow 路徑則為 7.3 秒;故障後 p50 首 token 延遲分別是 23,815 與 1,311 毫秒。不過這是 NVIDIA 自行設計的單一合成負載,只比較同節點程序故障。

工程團隊目前只能把它視為非生產評估功能:文件要求 Kubernetes 1.34、DRA v1 與 NVIDIA GPU DRA driver,主要後端是 vLLM;硬件、節點及多節點失效仍要靠一般重新排程。切換後 KV cache 亦是空的,既有前綴不能沿用。下一個關鍵里程碑,是能否安全移交 KV cache,並在 SGLang、TensorRT-LLM 及不同模型拓撲上重現收益。

來源

  1. Restore LLM Inference Capacity in Seconds with Shadow Engine Recovery in NVIDIA Dynamo
  2. Active-passive GPU failover example for Dynamo vLLM
  3. Shadow Engine Failover documentation