ホームへ戻る

模型訓練與代理

MidTool、ツール利用を中間学習へ前倒しし、Qwen3-4BのBFCLv3総合スコアを10.5ポイント向上

MidTool-Mixは、Web、PDF、コード、実際のツールインターフェースから203億tokenを合成し、モデルがSFTやRLに進む前に、ツールの境界、パラメータ、ワークフローを学習できるようにする。同一のSFTレシピを適用した場合、Qwen3-4BのBFCLv3総合スコアは39.73%から50.25%へ向上したが、深度検索タスクは依然としてまったく解決できていない。

Acroterion · CC BY-SA 4.0 · Image source
zh-Hant

ツール利用の学習は通常、教師ありファインチューニングまたは強化学習の段階まで先送りされる。Snowflakeやワシントン大学などの研究者が提案したMidToolは、この能力の獲得を基礎事前学習と後学習の間に位置する中間学習へ前倒しすべきだと主張する。MidTool-Mixは計203億token、1,122万サンプルを収録し、Web、PDF、コード、ネイティブなエージェント軌跡がそれぞれ42%、23%、26%、9%を占める。

このデータパイプラインは、文書をそのままモデルに入力するものではない。研究者はまずfastText、ハッシュ、MinHash LSHを用いてフィルタリングと重複排除を行い、その後、文書からツールの用途、スキーマ、パラメータ、ワークフローを抽出する。別の処理系では、REST API、MCPスキル、実際のrolloutを使い、実行可能な複数ターンの軌跡を合成する。ツール呼び出しについても、決定論的ルールによってターンの順序、必須パラメータ、応答の整合性を検証する。

チームは32基のH200を使用してQwen3-4B-Baseと8B-Baseをそれぞれ中間学習し、その後、両モデルに同一の10万件のTOUCANデータを用いてSFTを実施した。一部のバージョンではさらに、526個の合成環境でGRPOを実行した。4BモデルはMidTool-MixとSFTを追加しただけで、BFCLv3総合スコアがSFTベースラインの39.73%から50.25%へ向上し、RLを追加すると54.18%に達した。8Bの最良バージョンも、SFTベースラインの47.62%から55.12%へ向上した。実運用のMCPサーバーにより近いMCP-Universeでは、8Bの最良バージョンが総合スコア25.16を記録し、ベースラインは15.18だった。

この結果は、「ツール能力のすべてを後学習で急ごしらえする必要はない」という方向性を支持する一方、汎用エージェントにおけるブレークスルーにはまだ至っていない。MCP-UniverseのマルチサーバーおよびWeb検索の成功率は依然としてゼロで、通信タスクの成績も非常に低い。また、多くのデータがGPT-5シリーズとQwenの教師モデルによって合成されており、コスト、教師モデル由来のバイアス、データ汚染の監査については、今後も外部による再現検証が必要だ。エンジニアリングチームは今後、公開データを完全にダウンロードできるか、また同様の改善がモデルファミリー、ツール形式、実際の企業APIをまたいでも維持されるかに注目すべきだ。

出典

  1. MidTool: Mid-training Data Synthesis for Agentic Tool Use
  2. COLM 2026 Accepted Papers