返回首頁

Inference systems

vLLM 0.28 加入磁碟層級 KV 快取,Model Runner V2 支援編碼、預填與解碼拆分

vLLM 0.28.0 可把 KV 快取分層卸載至磁碟,並開放外部次級儲存管理器,讓長上下文服務不再只受 GPU 與主記憶體容量限制。新版也推進 Kimi-K3、DeepSeek V4、推測解碼及 E/P/D 拆分,但多項預設值與相依介面已改變。

Yuening Jia · CC BY-SA 3.0 · Image source
zh-Hant

vLLM 0.28.0 的核心改動是把 KV 快取分層從 CPU 延伸至磁碟。SimpleCPUOffloadConnector 現在支援 disk offload,外部模組可透過 `module_path` 實作次級 tier manager;系統亦能回報部分載入結果、輸出分層指標,並使用與平行拓撲無關的標準 CPU 佈局。這讓服務端能以較慢儲存換取更大的可重用前綴與長上下文容量,但實際收益仍取決於 SSD 延遲、吞吐、命中率及請求排程,不能把磁碟當成等價的 GPU 記憶體。

Model Runner V2 則加入 encoder/prefill/decode(E/P/D)拆分、權重卸載、多層 MTP KV cache、encoder CUDA Graph,以及無注意力模型與 pooling 工作負載支援。Rust frontend 和 gRPC 路徑新增獨立 renderer、多模態圖片推論、資料平行 rank 路由及強化學習生命週期控制,protobuf schema 也發布至 Buf,方便大型部署把前處理、模型執行與控制面分開演進。

模型最佳化集中在 Kimi-K3 與 DeepSeek V4。官方發布說明列出融合 FlashKDA kernel、Decode Context Parallel、sequence-parallel GEMM-RS,以及可每張 GPU 節省約 17 GiB 的 shared-expert sharding;DeepSeek V4 則取得 sparse MLA、MTP/DSpark 推測解碼及 ROCm 支援。這些數字多為特定 kernel 或配置的內部量測,不能直接外推至端到端吞吐。

升級前必須檢查破壞性變更:bitsandbytes 已移至外掛、Transformers 最低依賴升到 5.15,兩個舊 KV/attention 選項被移除;`max_num_batched_tokens` 預設由 8192 升至 16384,Blackwell CUDA Graph capture 上限也提高。生產環境應重新量測首 token 延遲、尾延遲、磁碟寫入放大與故障復原,再決定是否啟用分層快取及新 runner。

來源

  1. Release v0.28.0 · vllm-project/vllm
  2. vLLM 0.28.0