AI 基礎設施
NVLink 6 將鏈路重試、故障隔離與推論熱備援串成同一套復原堆疊
NVIDIA 公開 NVLink 6 的多層容錯設計,從實體層修正位元錯誤,一路延伸至 NMX 控制器與 Dynamo 推論程序。內部 B200 測試把故障後恢復雙 worker 服務的時間由 283 秒降至 7.3 秒,但檢查點工具及 NCCL 邊界案例仍在演進。

NVIDIA 新揭露的 NVLink 6 韌性架構,重點不只是提高鏈路可用率,而是把硬體錯誤處理、網路控制面與模型服務復原連成單一路徑。實體層先以輕量 Forward Error Correction 修正可恢復的位元錯誤;超出 FEC 能力時,由 Physical Layer Retry 在軟體介入前重傳封包。若鏈路進一步失效,UPHY 會重新校準實體參數,封包則暫存在 replay buffer。鏈路層另採 credit-based flow control,避免接收端緩衝區溢位造成丟包。
系統層使用具備備援路徑的 NMX Controller。偵測到元件異常後,網域可進入「contain and drain」狀態,停止把新流量送入故障區域,同時維持其餘資料面轉送;管理 CPU 重啟時,控制功能也能遷移至備援節點。這對 tensor parallel 與 expert parallel 工作負載特別重要,因為局部鏈路抖動可能讓所有 rank 同步停住,而非只損失單一 GPU。
推論端則由 Dynamo Shadow Engine Recovery 保留已初始化的待命程序,預先建立自己的 NCCL、NIXL communicator,並透過 GPU Memory Service 共用既有模型權重,避免在 HBM 再放一份完整副本。NVIDIA 在兩個 B200 worker、GLM-5.2 的故障注入測試中,讓第二個 worker 恢復服務的時間由冷啟動 283 秒縮至 7.3 秒;故障後 p50 TTFT 為 1,311 毫秒,冷啟動組則達 23,815 毫秒。
這些數字仍是供應商在單一模型與拓撲上的測量。更重要的部署問題是哪些狀態可以安全移交:CUDA checkpoint 專案仍不支援 UVM 與部分可匯出 IPC 記憶體,近期 NCCL issue 也記錄了 checkpoint/restore 在共享記憶體路徑可能永久鎖死。平台團隊應把鏈路降級、控制器重啟、rank 消失及 checkpoint 還原分開做故障演練,並以實際 MTTR、TTFT 與未完成請求數驗證,而不能把「lossless」理解成沒有應用層中斷。