推論與執行期系統
LMDeploy 0.17 導入 DeepEPv2 與 Mooncake KV 儲存,擴充跨節點 MoE 推論資料路徑
LMDeploy 0.17.0 為 TurboMind 加入 DeepEPv2 專家平行後端,並讓 KV connector 接上 Mooncake Store。新版亦支援 Kimi K2.6、非二次冪頁面與結構化回應,但未提供跨硬體的端到端效能數據。

InternLM 在 9 月 1 日發布 LMDeploy 0.17.0,更新焦點是大型 MoE 模型的通訊、記憶體與服務路徑。TurboMind 現可選用 DeepEPv2 作為 MoE all-to-all 後端:推論時,各 GPU 依路由結果把 token 派送至持有目標 expert 的裝置,再合併輸出。整合包含 token dispatch/combine、獨立的 expert-parallel 與張量平行通訊群組、多節點處理,以及 `--moe-a2a-backend` 設定面;這使通訊密集的 expert parallelism 不必只依賴既有 NCCL 路徑。
另一項改動是 KV connector 支援 Mooncake Store。它讓推論引擎可透過外部儲存交換 KV cache,為預填與解碼分離、跨實例快取重用或分層儲存提供新的接點。不過,版本說明沒有公布命中率、網路延遲或故障復原測試,因此不能直接推論它會改善所有長上下文服務;實際收益仍取決於提示重複度、互連頻寬與快取生命週期。
模型及核心方面,PyTorch engine 新增 Kimi K2.6 支援,並最佳化 compact-blocked FP8 MoE 路由準備及推測解碼前後處理;paged attention 與 V4 prefill 改用 PDL,記憶體頁面大小也不再限定為二次冪。服務層新增 `n>1` choices 的伺服器端 fan-out,TurboMind 與 PyTorch engine 均可輸出 `structural_tag` 格式,Anthropic 相容端點則修復 inline system message。
升級者應特別驗證兩處相容性:舊於 SM90 的 GPU 恢復 FP8 weight-only fallback,而 DeepEPv2 建置會引入 NCCL 版本與符號相容要求。官方沒有隨版本提供統一吞吐、首 token 延遲或多節點擴展曲線;部署前應以自身模型、批次分布及拓撲,比較 NCCL 與 DeepEP 後端,並測試 Mooncake 不可用時的降級行為。