返回首頁

代理系統與推論

同一模型兼任工具呼叫預測器,Qwen 4B 下一步命中率提高逾 17 點

研究團隊讓代理在推理期間預測並提前執行自己的下一個工具呼叫,以共用權重及 KV cache 取代外部草稿模型。聯合強化學習把兩款 Qwen 4B 模型的平均 Hit@1 分別提升至 61.2 與 66.3,但論文尚未量化真實並行部署的端到端加速。

Eugene Zelenko (thanks to my friends Nickolov family for generous help and company) · CC BY-SA 4.0 · Image source
zh-Hant

代理的延遲不只來自模型生成;搜尋、資料庫、程式執行器與子代理常讓整條工作流停在網路或服務回應上。加州大學聖塔芭芭拉分校與 LinkedIn 團隊提出「自我推測代理」,嘗試在模型完成當前推理前,先猜出下一個結構化工具呼叫並執行。若工具名稱與參數完全符合代理稍後真正產生的呼叫,系統便可直接採用已快取的結果。

既有方法通常另部署小型草稿模型,但實驗顯示,同系列小模型不一定理解目標代理的決策分布。以 Qwen3-4B 執行 MuSiQue 為例,0.6B、1.7B 草稿模型的 Hit@1 僅 4.3、14.7;由 4B 模型預測自己的下一步則達 25.3。外部模型還需額外權重與第二份 KV cache:論文在單張 H100、SGLang 測試中,Qwen3-0.6B 草稿方案使用 10.71GB,較自我推測的 8.70GB 高。

訓練時,同一模型在代理與推測兩種模式間交替更新;推測目標取自目前政策剛產生的 rollout,而非過期軌跡。加入監督式暖身、模式切換時重設最佳化器等穩定措施後,Qwen3-4B 的平均下一呼叫 Hit@1 從 44.1 升至 61.2,Qwen3.5-4B 從 48.9 升至 66.3,搜尋問答及 τ-bench 的任務成功率大致維持。

這項設計的工程價值在於不必常駐第二個模型,且可從共用前綴分支、重用 KV cache。不過 Hit@1 並不等於實際延遲降幅;錯誤推測會浪費外部 API、算力,甚至產生不可逆副作用。論文也只以每個領域 50 個查詢分析現成推測器,尚未報告具備取消、冪等性與成本控制的並行服務結果。下一步應觀察程式碼與模型權重是否公開,以及在慢速、高費用或有狀態工具上的淨收益。

來源

  1. Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent–Speculator RL
  2. SGLang:高效大型語言模型與視覺語言模型服務框架