返回首頁

AI 推論基礎設施

SGLang 0.5.18 重疊載入權重與 CUDA Graph,Qwen3-32B 冷啟動縮至 35.6 秒

新版在啟動時並行處理 checkpoint staging 與 CUDA Graph capture,官方 H100 測試較普通預設流程快 2.38 倍。它也重寫部分張量並行通訊並加入七個模型家族,但 Torch 升級與快取路徑整併帶來遷移成本。

Steroid Maximus · CC BY-SA 3.0 · Image source
zh-Hant

SGLang 0.5.18 把模型冷啟動視為可重疊的 I/O 與 GPU 初始化問題:checkpoint 頁面由儲存裝置載入及暫存的同時,系統開始捕捉 CUDA Graph,不再串行等待兩個階段。使用 `--startup-weight-load-mode overlap` 後,官方在單張 H100、Qwen3-32B 上測得 35.6 秒啟動時間,普通預設流程則為 84.8 秒。不過,與已啟用 prefetch 的串行流程相比,改善只有 8.6% 至 11.7%;「2.38 倍」不能直接外推到已有權重快取或不同儲存後端的叢集。

解碼路徑亦有兩項較具體的改動。純資料平行注意力配置中的 TP LMHead,原本需要 all-gather 再 scatter,現在可合併成一次 all-to-all;DeepSeek-V4-Pro 在 B200 的 LMHead 時間由 320 微秒降至 169 微秒,但整體 TPOT 只由 36.97 降至 35.67 毫秒。DeepSeek-V4-Flash 的 TP4 Blackwell 測試則藉 FlashInfer MNNVL 取代部分 NCCL all-reduce,小批次解碼最高改善 6.9%。這些數字顯示算子級加速未必等比例反映在端到端延遲。

0.5.18 同時加入 Muse Glimmer、SANA-Video、LTX-2.5 等七個自回歸或擴散模型家族,並整合 DSpark 的 logprob 輸出及多項 DeepSeek、Qwen、Kimi 修正。部署方升級前仍應留意破壞性變動:CUDA 堆疊轉至 Torch 2.13、Triton 3.7.1,`torchao` 整合被移除;Triton、FlashInfer、Inductor、DeepGEMM 等編譯快取也統一搬到 `SGLANG_CACHE_DIR`,首次啟動會重新編譯。對需要自動擴縮容的推論平台而言,下一步應在自身模型、網路檔案系統與預熱策略下重測冷啟動,而非只採用官方 H100 結果。

來源

  1. SGLang v0.5.18 release notes
  2. sglang 0.5.18 package
  3. SGLang Cookbook