ホームへ戻る

代理訓練

SkillGate、スキル選択と実行のフィードバックを分離し、9Bエージェントの成功率を40.8%から53.2%へ向上

SkillGateは、長いワークフローを実行するエージェントを結果報酬で訓練すると、スキル選択に使われる少数のtokenには有効な信用割当がほとんど届かないことを明らかにした。新手法は、同一のGRPO更新内で2つの勾配経路を分離し、5つのエージェント評価で結果報酬ベースラインを上回った。

HuBar · CC BY-SA 2.5 · Image source
zh-Hant

エージェントが数千件の`SKILL.md`から手順書を選ぶ処理は、一見すると単なるツール呼び出しに見えるが、タスク全体を完遂できるかどうかを左右し得る。SkillGateチームが12,800件の訓練軌跡を監査したところ、スキル名を指定するtokenが各軌跡の損失重みに占める割合の中央値は、わずか0.14%だった。また、選択の約5分の2は、その後の実行失敗によって負のadvantageを受けていた。軌跡が長いほど、この「セレクターの信用飢餓」は深刻になる。正しいスキルを読み込んだ場合でも、系列全体にブロードキャストされる結果フィードバックによって、選択アクションが誤った方向へ更新される可能性がある。

SkillGateは別個のルーティングモデルを構築せず、1回のGRPO更新内でtoken maskを用いて信用割当を分離する。タスク結果は実行tokenだけを更新し、もう一方の局所的なadvantageはスキル識別tokenだけを更新する。さらに、軌跡全体でスキルの読み込みがちょうど1回だけ行われ、かつアノテーション済みのoracleスキルが選択された場合に限って、正のシグナルを与える。2つの経路には同量のloss massを割り当て、実験でのセレクター係数は0.20とした。そのため、デプロイ時には通常のエージェントとして動作し、推論モデルや追加の意思決定ステップは必要ない。

SkillsBench、SETA、SWE、Terminal-Bench 2.0、およびテスト用に留保したClaw-Evalにおいて、各問題へ16個の候補スキルを混入させた設定では、Qwen3.5-9Bの成功率はSFT後で40.8%、通常の結果報酬RLで47.0%、SkillGateで53.2%に達した。oracleスキルを読み込む割合は54.3%から83.9%へ上昇し、誤誘導スキルに接触する割合は69.6%から21.8%へ低下した。コード、アセット、評価パイプライン、最終weightsは公開されている。一方で、この手法は訓練時にoracleスキルラベルを必要とし、モデルはOpenClaw形式のプロンプトフォーマットに依存する。異なるモデルやスキルライブラリ、クリーンなラベルがない環境でも有効かどうかについては、今後の独立した再現検証が必要だ。

出典

  1. SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents
  2. SkillGate source code and evaluation artifacts
  3. SkillGate-9B model checkpoint