推論系統
vLLM 0.28.0 為 Kimi K3 分拆共享專家,每張 GPU 減少約 17 GiB 權重記憶體
新版同時加入 Decode Context Parallel、融合式 FlashKDA 核心及自適應推測 token 預算,並讓 DeepSeek V4 的稀疏 MLA 貫通一般與推測解碼。部分速度數字只量度個別核心或特定 DSpark 配置,升級前亦須處理預設值與外掛介面的破壞性變更。

vLLM 0.28.0 把重點放在大型混合專家模型的通訊、記憶體及解碼路徑。[發布說明](https://github.com/vllm-project/vllm/releases/tag/v0.28.0)列出 584 次提交,Kimi K3 現可使用 Decode Context Parallel,把一條序列沿解碼上下文切給多個 rank;FlashKDA 的 prefill 與 decode 則改用融合核心,減少中間張量及核心啟動開銷。序列平行路徑亦合併部分 all-gather,官方稱相關核心快 1.5 至 3 倍,但這不是整個服務端到端吞吐量。
更直接影響部署容量的是可選的共享專家切分。Kimi K3 的共享 MLP 原本在各 rank 複製完整權重;啟用 `VLLM_KIMI_K3_SHARD_SP_SHARED_EXPERT` 後,每個 rank 只保存中間維度的一部分,再以 all-gather 與 reduce-scatter 完成運算。[模型文件](https://docs.vllm.ai/en/v0.28.0/api/vllm/models/kimi_k3/nvidia/model/)說明了額外集體通訊,發布說明則估計每張 GPU 可少用約 17 GiB。工程團隊應實測這項記憶體收益是否足以抵銷自身拓撲上的通訊成本。
推測解碼方面,自適應 token 預算在官方 DSpark 測試把首 token 時間改善約 60%;DeepSeek V4 也補齊稀疏 MLA 對一般 decode、MTP 與 DSpark 的端到端支援。Model Runner V2 新增 E/P/D 分拆、權重卸載及多層 MTP KV cache,KV cache 次級層現在可卸載至磁碟或由外部模組管理。
這不是零風險更新:`max_num_batched_tokens` 預設值由 8,192 升至 16,384,可能改變峰值記憶體與排程延遲;bitsandbytes 被移至樹外外掛,Transformers 升至 5.15.0,數個舊參數及輸出欄位亦遭移除。正式升級前應重跑服務層的 TTFT、每用戶輸出速率、顯存及客戶端相容性測試,而不能只沿用單一核心的加速比例。