GitHub Repo
vLLM 0.30.0 納入常駐 GPU 權重快取,支援引擎重啟後重用
Fast Start 透過 CUDA IPC 重用已處理的權重,減少引擎重啟時的磁碟載入。零拷貝模式與 sleep mode 不相容,部署者也須驗證平行配置及快取回退行為。

vLLM 於 9 月 22 日發布 0.30.0,納入 Fast Start 權重快取機制。它把模型權重的生命週期移出推論引擎:每張 GPU 由獨立常駐程序保留已完成量化處理與張量平行切分的權重,引擎重啟時再接回。版本公告也列出 FP4 檢查點與多節點張量平行支援。[版本公告](https://github.com/vllm-project/vllm/releases/tag/v0.30.0)
這項設計針對服務重啟時的重複載入成本。實作透過本機 Unix socket 交付 CUDA IPC 控制代碼,讓新引擎映射既有顯存;啟動時指定 `--load-format ipc_cache` 即可選用。對反覆調整服務設定、但沿用相同模型權重的部署而言,這提供了減少磁碟讀取的途徑。[實作提案](https://github.com/vllm-project/vllm/pull/54921)
載入器先在 meta 裝置建立模型骨架,再以快取張量替換參數與緩衝區,跳過權重載入後的處理。預設 `zero_copy` 模式共用常駐程序的顯存;`copy` 模式則複製到引擎自身的記憶體,再要求釋放快取。兩者的記憶體所有權不同,故障回復與顯存規劃也必須分開驗證。[載入器文件](https://docs.vllm.ai/en/v0.30.0/api/vllm/model_executor/model_loader/weight_cache/ipc_loader/)
適用配置仍有界線。常駐程序支援張量與專家平行,啟動時會拒絕管線及資料平行。多節點部署須在各節點啟動程序、協調全域張量平行群組;IPC 控制代碼仍只在節點內使用,各引擎工作程序取得本機 GPU 的權重分片。[部署文件](https://docs.vllm.ai/en/v0.30.0/api/vllm/model_executor/model_loader/weight_cache/daemon/)
另外,快取程序無法連線或設定指紋不符時,預設會退回磁碟載入;服務能啟動不代表快取已命中。零拷貝模式也不能搭配以 CuMemAllocator 卸載權重的 sleep mode,既有節省顯存流程需要重新核對。[相容性說明](https://docs.vllm.ai/en/v0.30.0/api/vllm/model_executor/model_loader/weight_cache/ipc_loader/)
從架構推論,收益取決於權重能否持續留在同一批 GPU,以及原先載入占啟動時間的比例。工程團隊應分別測量快取命中、磁碟回退與常駐程序重啟,記錄服務就緒時間、首筆請求延遲及顯存峰值。模型權重之外,服務仍須建立排程與通訊等執行狀態;量測應涵蓋整段初始化,才能判斷維運停頓是否縮短。公告沒有提供可普遍套用的 Fast Start 加速倍數,也不能據此推定正常生成吞吐量會提高。