返回首頁

代理訓練與基礎設施

ClawGym II 透過代理框架邊界擷取軌跡,讓黑箱 Claude Code 也能參與強化學習

ClawGym II 不改動代理框架內部,而是在模型服務邊界攔截呼叫,再以 prefix tree 還原多輪軌跡。Qwen3-30A3B 經訓練後,在 OpenClaw 與 Claude Code 執行 ClawGym-Bench 的 Pass@1 分別增加 9.98 與 14.81 個百分點。

LogicFlow99 · CC0 · Image source
zh-Hant

代理強化學習通常假設研究者能控制完整 agent loop,但 Claude Code、OpenClaw 一類 harness 會自行管理提示、工具、子代理與上下文,內部流程並不適合直接接入傳統 RL trainer。8 月 17 日提交的 ClawGym II 改從模型服務邊界切入:每個任務與 harness 在暫存沙箱中執行,代理所有模型請求經過 serving proxy,訓練系統因此毋須理解框架內部實作,也能記錄提示、回覆及分支關係。

擷取到的呼叫不是天然的線性 rollout。研究團隊把共享前綴與後續分支整理成 prefix tree,並修改 PPO 與不使用 critic 的 GRPO,使策略更新能在還原後的樹狀軌跡上計算,同時維持訓練、推論時實際使用同一套 harness。系統亦支援 mix-harness training,讓單一模型從不同代理框架的控制流共同學習,而非只適配某一種提示模板。

以 Qwen3-30A3B 為基礎時,論文報告 ClawGym-Bench Pass@1 經 OpenClaw 訓練提升 9.98 個百分點,經 Claude Code 提升 14.81 個百分點,並可穩定訓練 200 至 400 個更新步驟;JobBench、OfficeQA 亦錄得增益。這使「商用或快速演進的代理框架作為黑箱環境」成為可行訓練介面,工程團隊可保留生產 harness 的工具語義及上下文管理。

不過,現有數字仍來自作者控制的模型、沙箱和評測組合,尚不能證明跨供應商 harness 的提升會普遍成立。值得追蹤的是完整 ClawGym II 訓練程式、運算成本與失敗軌跡是否公開,以及代理框架更新提示或工具協定後,serving proxy 能否維持可重現的策略梯度。

來源

  1. ClawGym II: Exploring Black-Box RL on Agent Harness
  2. ClawGym official repositories and benchmark artifacts