返回首頁

代理執行期與推論系統

Speculative Macro Commit 預先執行代理工具鏈,AppWorld 牆鐘時間縮短 44.9%

新研究讓小型草稿模型在隔離環境快照中預跑多步工具操作,再由大型權威模型確認第一步後一次提交整段結果。方法在兩項代理基準降低延遲,但需要三張 GPU,且 AppWorld 的任務完成率由 41.67%降至 40.48%。

Copyleft · CC0 · Image source
zh-Hant

工具型代理的延遲不只來自模型生成 token,也來自「決策、呼叫工具、等待觀察、再決策」的串行依賴。Speculative Macro Commit(SMC)把投機解碼的概念移至代理執行期:大型 actor 保有正式決策權,小型 drafter 則在隔離的環境快照上預測並執行未來動作鏈。

系統先從成功訓練軌跡挖掘重複出現的多步工具骨架,將任務特定的使用者 ID、文件 ID 或時間戳替換成 slot,形成 macro library。執行時,若 actor 的下一個工具呼叫與草稿鏈第一步相符,系統便可在通過參數、狀態及最小深度檢查後,把後續已執行步驟及觀察結果一併寫入正式軌跡。actor 不會看到額外的 macro 工具,因此不用重新學習一種動作介面。

研究以 INT4 Qwen3.5-27B 擔任 actor、Qwen3.5-4B 擔任 drafter。在 τ²-Bench Telecom 的 2,285 項結果中,SMC 與串行基線同為 99.52%準確率,每項平均延遲由 27.60 秒降至 22.47 秒;相較只重用單一步驟的 Speculative Actions 也快 10.23%。AppWorld 平均時間則由 355.7 秒降至 195.9 秒,但完成目標的任務由 70/168 降至 68/168。

成本與安全邊界仍限制實用性。串行基線只用一張 GPU,兩種投機配置則使用 actor、投機請求副本與 drafter 共三張 GPU,因此牆鐘時間下降不代表總運算成本下降。宏匹配本身的未過濾精確率僅 34.6%,完整規則在百項留出任務中雖保持所有實際提交事件的結果,仍不是一般性的安全證明。下一步應在程式代理、具不可逆副作用的 API、不同模型組合及相同硬體預算下重現,並量測錯誤提交、回滾與快照成本。

來源

  1. Speculative Macro Commit for Faster Tool-Using Agents
  2. The Gradient — 2026-09-05