返回首頁

模型架構與代理工具使用

循環式推論改善多工具組合,1B Llama 的 BFCL 平均分由 21.4 升至 32.9

研究讓同一組 Transformer 層在生成每個 token 前反覆更新隱藏狀態,並以相同資料及 LoRA 設定比較循環與一般模型。提升集中在平行呼叫及跨呼叫依賴;以單一 API 呼叫為主的 API-Bank 則未呈現一致優勢。

Sattler, Christian Friedrich, 1705-1785 · No restrictions · Image source
zh-Hant

一般自回歸模型每產生一個 token,只讓資料通過固定深度的 Transformer 一次;looped language model 則重複使用同一組參數,在輸出 token 前迭代更新隱藏狀態。新研究測試這種「增加深度但不增加權重」的做法,是否能改善代理選擇函式、組合多個呼叫,以及把前一個 API 的輸出正確綁定至下一個參數。

團隊比較原生循環架構 Ouro-1.4B、Ouro-2.6B,以及由 Llama-3.2-1B、OLMo-2-1B 改造的循環版本。受控模型均使用 Hermes function-calling 資料、相同 LoRA rank 32、兩個 epoch、4,096-token 上限及 A100 80GB 訓練。BFCL 的 Simple、Multiple、Parallel 與 Parallel-Multiple 四類平均結果中,Llama-3.2-1B 經一般 SFT 得 21.4,循環版本為 32.9;其中 Parallel 類由 14.0 升至 31.0。OLMo-2-1B 的平均分則由 39.1 小幅升至 41.8。

需要消化前一呼叫輸出的 NESTful 更能顯示深度效應。Ouro-2.6B 的 SFT 版本取得 0.371 win rate,高於列入比較的 Qwen3-8B-Instruct 0.345;固定模型後增加循環次數,巢狀工作流的分數通常繼續上升。模型逐 token 決定是否停止的 adaptive gate,也能以少於固定四次的平均迭代量,維持相同 NESTful 分數。

不過,Ouro 沒有在完全相同預訓練條件下的非循環版本,因此無法把全部差距歸因於 recurrence;改造後的模型在深層巢狀任務仍明顯落後原生循環模型。三項評測亦都是靜態、單輪測試,尚未涵蓋工具失敗、重試與狀態漂移。下一步應量測實際 token 延遲、KV cache 與記憶體成本,並在可執行的多輪環境確認自適應深度是否仍比直接使用更大模型划算。

來源

  1. Looped Language Models Improve Compositional Tool Calling
  2. NESTFUL 官方程式碼與 1,861 項巢狀 API 評測資料
  3. Berkeley Function-Calling Leaderboard