返回首頁

推論基礎設施

vLLM 0.29 將 Model Runner V2 設為全模型預設,升級同時牽動快取、通訊與啟動介面

vLLM 0.29.0 完成 Model Runner V2 的預設切換,並擴充推測解碼、強化學習權重同步及多種硬體後端。這不是可直接替換映像的小更新,既有部署需重新驗證記憶體配置、輸出一致性與已移除介面。

Cepice · CC BY-SA 4.0 · Image source
zh-Hant

vLLM 0.29.0 納入 594 項提交,核心變化是讓 Model Runner V2(MRV2)成為所有模型的預設執行路徑。新版以 CUDA Graph 的實際保留量估算 KV cache、支援分片取樣與 prompt embedding,並修正休眠、關閉及多模態快取中的記憶體生命週期問題。這代表升級可能改變可容納的序列數與圖捕獲配置;即使 API 不變,原有的顯存調校結果也不應直接沿用。

面向大規模推論,0.29 加入佇列請求數與 token 數的 admission control,讓服務在超載前限制排隊量;分散式 KV 路徑則新增非同步載入、請求級 P2P offload,以及更多 Mooncake、NIXL 與 context parallelism 整合。強化學習工作流取得 `sharded_rdt` 權重同步後,每個 worker 可只接收自己的 tensor/expert parallel 分片,避免完整權重在節點間重複搬運。推測解碼也能回報逐請求接受率,較容易判斷草稿模型是否真的節省計算。

硬體更新橫跨 NVIDIA、AMD、Intel 與 CPU。官方列出的部分增益包括 Mamba 前綴快取首 token 延遲改善 9% 至 25%,以及特定 Blackwell 自動調校降低 33.6% 端到端延遲;這些都是特定模型與平台上的專案測試,不能外推至一般服務。

遷移風險同樣明確:十種舊模型架構與 PyAV 影片後端遭移除,舊式 Python API server 啟動方式進入棄用期,FlashInfer all-reduce 及部分前綴快取行為也改了預設值。工程團隊應以固定模型、批次形狀及硬體做升級前後回歸,特別檢查 CUDA Graph 顯存、prefix-cache logits、pipeline parallel 正確性與 ROCm fallback;MRV1 雖仍保留給未支援功能,但已不再是主路徑。

來源

  1. Release v0.29.0 · vllm-project/vllm
  2. vLLM v0.29.0公開 — Model Runner V2が全モデルの既定に、新モデル対応とRL重み同期を強化