返回首頁

AI 研究與代理訓練

ToolGrad 反轉工具使用資料生成流程,500 筆合成資料讓 Gemma 3 12B 的 BFCL 分數升至 83.1

Google 的 ToolGrad 先建立可執行的 API 鏈,再反向生成對應指令,避開傳統代理以搜尋碰運氣找答案的低效率。實驗顯示小型資料集即可改善未見工具上的函式呼叫能力,但結果仍集中於單輪基準與合成工作流。

Simon Bening · Public domain · Image source
zh-Hant

Google Research 9 月 10 日公開 ToolGrad 的完整技術說明,將工具使用資料的建立順序由「先寫問題、再搜尋解法」反轉成「先驗證解法、再生成問題」。傳統 ToolBench 類流程會讓代理以 DFS 反覆嘗試 API;路徑越長,任一步參數或工具選擇出錯都會使整筆標註失效。ToolGrad 則從逾 1.6 萬個 API 中逐步組合一條成功工作流,再讓模型補上與該流程一致的使用者指令及答案。

系統每輪包含四個模組:API Proposer 縮小候選工具,並行 Executors 實際呼叫工具,Selector 根據執行報告選出下一步,Updater 再同步改寫指令與回覆。Selector 產生的自然語言回饋被稱為「文字梯度」;它不是可微分梯度,而是告訴下一輪哪些工具及參數值得保留。官方報告的資料生成通過率達 99.8%,因此主要節省來自減少失敗軌跡,而非降低單次模型推論成本。[Google Research](https://research.google/blog/toolgrad-efficient-tool-use-dataset-generation-with-textual-gradients/)

團隊用 500 筆生成資料微調 Gemma 3 的 1B、4B 與 12B 版本。在使用不同工具集合的 Berkeley Function Calling Leaderboard 單輪項目中,三種尺寸相對基礎模型分別增加 8.1、8.0 與 6.3 分;12B 版本取得 83.1,接近論文所列 Gemini 2.5 Pro 的 83.2。增益在合成的 non-live 子集高於真人查詢子集,顯示模型可能同時學到資料生成器或基準的結構偏好。[論文](https://arxiv.org/abs/2508.04086)

對代理團隊而言,這套方法可用來建立企業內部 API 的冷啟動訓練集,尤其適合可安全重放、輸出能自動驗證的唯讀工具。不過目前證據主要來自單輪函式呼叫;長時間狀態變化、不可逆操作、權限錯誤及跨工具副作用仍未被充分測試。下一步應觀察相同方法能否在真實沙箱中維持成功率,以及人工稽核後是否仍保有成本優勢。

來源

  1. ToolGrad: Efficient tool-use dataset generation with textual “gradients”
  2. ToolGrad: Efficient Tool-use Dataset Generation with Textual “Gradients”