返回首頁

模型訓練與代理

MidTool 將工具使用前移至中期訓練,Qwen3-4B 的 BFCLv3 總分提高 10.5 點

MidTool-Mix 從網頁、PDF、程式碼與真實工具介面合成 203 億 token,讓模型在 SFT、RL 之前先學習工具邊界、參數與工作流程。配合相同 SFT 配方時,Qwen3-4B 的 BFCLv3 總分由 39.73% 升至 50.25%,但深度搜尋任務仍完全未解。

Acroterion · CC BY-SA 4.0 · Image source
zh-Hant

工具使用通常留到監督微調或強化學習階段處理。Snowflake 與華盛頓大學等研究者提出 MidTool,主張把這項能力提前到基礎預訓練與後訓練之間的中期訓練。MidTool-Mix 共含 203 億 token、1,122 萬筆樣本:網頁、PDF、程式碼與原生代理軌跡分別佔 42%、23%、26% 與 9%。

資料管線不是把文件直接餵給模型。研究者先以 fastText、雜湊及 MinHash LSH 過濾與去重,再從文件抽取工具用途、結構描述、參數及工作流程;另一分支則以 REST API、MCP 技能和實際 rollout 合成可執行的多輪軌跡。工具呼叫還會經確定性規則檢查回合順序、必要參數及回覆一致性。

團隊在 32 張 H200 上分別中訓練 Qwen3-4B-Base 與 8B-Base,再使用相同的 10 萬筆 TOUCAN 資料做 SFT,部分版本另以 526 個合成環境執行 GRPO。4B 模型僅加入 MidTool-Mix 與 SFT,BFCLv3 總分便由 SFT 基線的 39.73% 升至 50.25%;加入 RL 後達 54.18%。8B 的最佳版本則由 SFT 基線 47.62% 升至 55.12%。在較貼近實際 MCP 伺服器的 MCP-Universe,8B 最佳版本總分為 25.16,基線為 15.18。

結果支持「工具能力不必全靠後訓練臨時灌入」的方向,但尚非通用代理突破。MCP-Universe 的多伺服器與網路搜尋通過率仍為零,電信任務亦很弱;多項資料由 GPT-5 系列與 Qwen 教師合成,成本、教師偏差及污染審計仍需外部重現。工程團隊接下來應關注公開資料能否完整下載,以及同樣增益能否跨模型家族、工具格式與真實企業 API 保持。

來源

  1. MidTool: Mid-training Data Synthesis for Agentic Tool Use
  2. COLM 2026 Accepted Papers