推論與基礎設施
vLLM 0.26 擴充跨層 KV 快取與混合注意力,DeepSeek-V4 推論核心同步加速
vLLM 0.26 讓不同 KV-cache 群組選用各自的注意力後端,並把物件儲存納入分層快取。新版也集中最佳化 DeepSeek-V4、ROCm、XPU 與推測解碼,但官方微基準不能直接代表實際服務吞吐。

vLLM 於 7 月 27 日發布 0.26.0,合併 212 名貢獻者的 411 次提交。此次最值得部署團隊注意的不是新增模型數量,而是引擎開始把混合架構與大型叢集視為常態:每個 KV-cache 群組現在可以選擇不同注意力後端,滑動視窗也成為後端明確宣告的能力,讓同時包含完整注意力、局部注意力或其他狀態空間模組的模型,不必再被迫使用單一路徑。
KV offloading 亦從單純搬往 CPU,擴展為分層次級儲存。新版加入讀寫量、查找延遲等指標,可透過 workload identity 接入物件儲存,並辨識 data-parallel replica;encoder cache 也新增 CPU connector。這些元件有利於長上下文及前綴重用,但遠端儲存延遲、網路流量和快取命中率仍會決定實際收益,不能只看顯存節省量。
硬體端的主軸是跨供應商最佳化。專案為 DeepSeek-V4 加入專用路由核心,官方提交測得端到端每 token 時間改善 2.94%;`fused_topk_bias` 單一核心則快 1.5 至 2 倍。ROCm 獲得兩階段 compressor、稀疏 prefill/decode 與 DSpark 推測解碼,XPU 也加入 DSpark;Qwen3.5 則融合更多 RMSNorm、通訊與 H20 路徑。這些數字多來自個別 PR 的受控環境,版本說明沒有提供統一硬體、批次與序列長度下的整體比較。
此外,Rust 前端補上音訊、影片與原生 `vllm-bench`,API 新增 endpoint plugin 框架。升級者應先重跑自身的長上下文、混合模型與多副本壓測,特別觀察 KV tier 查找延遲、推測解碼接受率,以及新版核心在 CUDA、ROCm、XPU 間是否維持相同數值結果。