返回首頁

代理基礎設施/推論排程

代理工作流排程延後提交已就緒回合,壅塞時 P95 完成時間最多縮短 71.4%

新研究把「回合已就緒」與「送入推論引擎」拆開,以 CVaR 尾部風險及動態工作量預算決定提交順序。SWE‑bench 軌跡重播中最高得到 3.5 倍 P95 加速,但結果只涵蓋固定代理軌跡、單一到達亂數種子與 A100/vLLM 環境。

Cepice · CC BY-SA 4.0 · Image source
zh-Hant

一篇 9 月 10 日提交的[新論文](https://arxiv.org/abs/2609.10964)指出,代理工作流的延遲問題不只存在於 vLLM 等推論引擎內部,也發生在請求進入引擎之前。一般代理執行器會在工具完成、下一個模型回合就緒時立即提交;輕載時這很合理,但壅塞時大量「已提交、尚未完成」的回合會堆在引擎內,工作流排程器也就失去重新排序它們的能力。

研究團隊提出的排程器刻意分離 readiness 與 release。它以平均完成時間加上 Conditional Value at Risk(CVaR)建立目標函數:當一個工作流的年齡跨過線上估計的第 95 百分位門檻,優先權會提高;這個延遲權重再除以當前回合的估計工作量。工作量由提示 token 與僅根據已完成回合推算的輸出長度組成,不偷看當前回合的真實輸出。

第二個控制環是「已承諾工作」預算。排程器監測平均佇列延遲、P95 佇列延遲及等待請求數;壅塞升高便縮小可送入引擎的 token 等價工作量,容量充裕時再放寬。若回合等待超過 180 秒,則以防飢餓規則優先處理。這種做法不修改 vLLM 內部排程,而是在代理執行器與共享推論服務之間增加一層准入控制。

實驗以 vLLM 0.20.2 重播 mini‑swe‑agent 的 SWE‑bench 與 SWE‑Gym 軌跡,各取 100 個工作流、約 1,600 個模型回合;Qwen3‑8B、Qwen3‑32B 與 Llama‑3.3‑70B 分別使用一、二及四張 80GB A100。最低負載時,新方法與立即提交的 P95 比值介於 0.99 至 1.00;最高案例則把 Llama‑3.3‑70B 的 P95 從 1,986.3 秒降至 568 秒,縮短 71.4%。消融實驗顯示主要收益來自尾部風險排序,動態預算另帶來約 10.7% 至 11.6% 改善。

這仍不是通用生產結論:每個資料點只使用固定到達種子,P95 又由 100 個工作流中的少數樣本決定;重播的工具延遲與回合內容也不會像真實代理般因排程結果而改變行為。下一步應在多租戶、模型路由、前綴快取與失敗重試並存的線上環境驗證,並觀察延後提交是否犧牲個別短任務或互動式請求的服務水準。

來源

  1. Decoupling Readiness from Release for Tail-Aware Scheduling of Agentic LLM Workflows
  2. Decoupling Readiness from Release for Tail-Aware Scheduling of Agentic LLM Workflows — index record