返回首頁

代理訓練

SkillGate 分離技能選擇與執行回報,9B 代理成功率由 40.8% 升至 53.2%

SkillGate 發現,長流程代理以結果獎勵訓練時,選擇技能的少量 token 幾乎收不到有效信用。新方法在同一次 GRPO 更新內拆分兩條梯度通道,並在五項代理評測中優於結果獎勵基線。

HuBar · CC BY-SA 2.5 · Image source
zh-Hant

代理從數千份 `SKILL.md` 選擇程序文件,看似只是一次工具呼叫,卻可能決定整段任務能否完成。SkillGate 團隊稽核 12,800 條訓練軌跡後發現,指出技能名稱的 token 僅佔每條軌跡損失權重中位數 0.14%;約五分之二的選擇還因後續執行失敗而取得負 advantage。軌跡愈長,這種「選擇器信用飢餓」愈嚴重:即使讀對技能,廣播至全序列的結果回報仍可能把選擇動作往錯誤方向更新。

SkillGate 沒有另建路由模型,而是在一次 GRPO 更新中以 token mask 分離信用。任務結果只更新執行 token;另一個局部 advantage 僅更新技能識別 token,而且只有整條軌跡恰好讀取一次、並選中標註的 oracle 技能時才給正向訊號。兩通道採等量損失質量,實驗中的選擇器係數為 0.20,因此部署時仍是普通代理,不增加推論模型或額外決策步驟。

在 SkillsBench、SETA、SWE、Terminal-Bench 2.0 與保留作測試的 Claw-Eval、每題混入 16 個候選技能的設定下,Qwen3.5-9B 經 SFT 後成功率為 40.8%,一般結果獎勵 RL 為 47.0%,SkillGate 則達 53.2%。讀取 oracle 技能的比例由 54.3% 升至 83.9%,接觸誤導技能的比例由 69.6% 降至 21.8%。程式、資產、評測流程與最終權重已公開,但方法在訓練期需要 oracle 技能標籤,且模型依賴 OpenClaw 風格提示格式;跨模型、不同技能庫及無乾淨標籤環境的效果仍需獨立重現。

來源

  1. SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents
  2. SkillGate source code and evaluation artifacts
  3. SkillGate-9B model checkpoint