返回首頁

代理訓練

MidTool 釋出 203 億 token 工具中訓練集,4B/8B 模型在三類代理測試均獲益

MidTool 把 API、MCP、文件、程式碼與合成工作流放進預訓練後、SFT 前的專門階段。資料集與模型檢查點已公開,但深度搜尋測試仍為零分,顯示學懂 schema 不等於具備長程研究能力。

Acroterion · CC BY-SA 4.0 · Image source
zh-Hant

MidTool 將一般工具使用視為應在 mid-training 建立的基礎能力,而非等到少量 SFT 或強化學習軌跡才補上。團隊公開的 MidTool-Mix 包含約 203 億 token、1,122 萬筆樣本:42% 來自技術網頁、26% 是程式碼、23% 是 PDF,另有 9% 原生代理軌跡。Hugging Face 同時提供資料集、4B/8B mid-training 與 RL 檢查點,以及用來篩選網頁和 PDF 的 FastText 分類器。

資料管線先從 FineWeb、FinePDFs、GitHub、REST API 定義、MCP skills 與文件型工作流收集素材,再依來源清理。程式碼會排除基準儲存庫以降低污染,文字以教師標註訓練的分類器篩出文件密集內容,最後用 MinHash LSH 去重。合成階段一條路徑從文件抽取工具 affordance,生成有上下文依據的問答及多輪操作;另一條直接從工具 schema 建立單次呼叫、多工具計畫和資訊不足情境,迫使模型學會選工具、填參數、排序步驟及要求澄清。

研究人員以 MidTool-Mix 繼續訓練 Qwen3-4B-Base 與 8B-Base,再套用相同 SFT 或 RL。相較只做後訓練及使用一般 mid-training 語料的基線,兩個尺寸在 BFCLv3、τ²-bench 與 MCP-Universe 均有提升;4B 模型在 τ²-bench 的 Pass@1 接近 SFT-only 基線兩倍,且後續 SFT 起始損失更低。不過 MCP-Universe 的 deep-search 子集仍是 0.00,說明參數 grounding 與短工作流遷移,尚未轉化為反覆蒐證及長程控制。工程團隊下一步應關注教師模型依賴、合成偏差、基準污染審計,以及 203 億 token 訓練成本是否勝過更小型的針對性 SFT。

來源

  1. MidTool: Mid-training Data Synthesis for Agentic Tool Use
  2. MidTool/MidTool-Mix
  3. MidTool models and filtering classifiers