AI 基礎設施
MISA-T 以 KV 駐留時間調度混合式 RL rollout,Step3.7 吞吐提高 53.3%
MISA-T 不只依前綴命中選擇推論節點,還限制不同工作負載可同時占用 KV 快取的 session 數量。作者在 Step3.7 與 Qwen3.6-35B-A3B 測得 43.6% 至 53.3% 的 rollout 吞吐增益,但實作尚未公開。

大型模型的強化學習後訓練,正把 RLVR、RLHF 與會呼叫工具的多輪代理軌跡送進同一組非同步推論服務。現有前綴感知路由器通常把請求派到已有最長相同前綴的節點,卻沒有控制多少新 session 能進入有限的 KV 快取;高併發時,長駐留的代理軌跡可能驅逐其他前綴,造成重新 prefill、排隊時間變長與更多快取淘汰。
南京大學與階躍星辰團隊提出 MISA-T,把「放在哪裡」與「何時准入」拆開。路由層根據快取壓力動態調整新 session 上限,再按 RLVR、RLHF、代理任務各自的 KV footprint 分配受保護容量。計算需求不只看 token 數,也以 KV block 乘上駐留時間;代理等待外部工具回應、模型暫時沒有運算時,仍會被計入占用成本。既有 session 的 continuation 優先保留,新工作則可被暫緩並重新評估。
相對經過併發參數掃描的 vLLM Router,rollout-only 測試中,MISA-T 令 Step3.7 與 Qwen3.6-35B-A3B 的完成樣本率分別增加 53.3% 和 43.6%,前綴命中率維持 97.8% 與 95.3%。在 Step3.7 的 50 輪端到端訓練中,rollout 吞吐提高 35.6%、平均 iteration 時間下降 22.8%,完成工作組成偏離訓練器目標的幅度亦由 4.14 降至 2.71 個百分點,任務分數則相近。
這項結果提醒工程團隊:混合 rollout 的瓶頸不一定是單次推論,而可能是 session 對未來 KV 容量的隱性承諾。不過數字來自兩個模型與作者部署環境,MISA-T 還要求請求帶有可靠的工作類別標籤,並依賴及時的快取狀態快照;快照延遲或工作分布突變都可能使 admission cap 暫時失準。論文也尚未提供可直接整合 vLLM Router 的程式,下一步應觀察公開實作、跨叢集重現,以及在模型更新與不同工具延遲下是否仍免於重新調參。