AI 基礎設施
Megatron-LM 擴充前綴感知路由與動態批次,混合模型推論開始共用 KV、Mamba 狀態
NVIDIA 彙整 9 月首週 Megatron-LM 變更,將資料平行推論前端、前綴快取與可變長序列處理推進至更完整的服務路徑。新功能改善混合 Transformer/SSM 模型的狀態重用,但官方尚未公布吞吐量、首 token 延遲或跨節點擴展數據。

NVIDIA 在 9 月 7 日公布 [Megatron-LM 月度進度](https://github.com/NVIDIA/Megatron-LM/issues/7100),彙整截至 6 日的 58 個實質合併項目。推論端最值得注意的變化,是 HTTP 前端可依資料平行副本擴展,tokenization 等 CPU 工作不再阻塞協調器事件迴圈;路由器則同時考量副本負載與前綴快取命中,讓共享系統提示或長文件前綴的請求更可能送往已保存相關狀態的 GPU。
底層的 `DynamicInferenceContext` 管理飛行中批次及區塊式 KV cache,可在每一步加入、暫停或移除不同長度的請求。新版亦避免閒置用的 dummy forward 清除前綴索引,並替 Mamba、GatedDeltaNet 等混合架構加入狀態槽:除了注意力層的 KV,重複前綴還能重用 SSM 與卷積狀態。官方 [API 文件](https://docs.nvidia.com/megatron-core/developer-guide/latest/apidocs/core/core.inference.contexts.dynamic_context.html) 顯示,這些快取仍受預先配置的 GPU 記憶體預算與區塊邊界約束。
訓練路徑則擴大可變長、packed sequence 與 runtime context parallelism,讓每個 microbatch 使用不同的上下文平行子群組;MFSDP 也改善通訊排序、預取和持久參數/梯度儲存。這些工作對長上下文及混合注意力模型很重要,因為固定拓撲容易在序列長度差異大時造成閒置或記憶體浪費。
不過,這是一份主幹活動報告而非穩定版發布,部分 DeepSeek V4、prefill/decode 分離與局部 CUDA Graph 功能仍列為進行中。部署者應逐項核對合併狀態,並自行測量快取命中率、TTFT、取消請求後的記憶體回收,以及不同路由係數造成的負載偏斜;目前不能從功能數量推論實際效能提升。