代理訓練/強化學習
OpenForgeRL 將真實代理框架接入強化學習,以代理伺服器解耦訓練與執行
Microsoft Research 等研究者提出 OpenForgeRL,讓 Codex、OpenClaw 與 GUI 代理可在原生執行框架內接受端到端強化學習。系統以模型呼叫代理伺服器和 Kubernetes 隔離 rollout,但程式、資料與權重仍待完整公開。

代理模型上線時通常不是單獨運作,而是被 Codex、OpenClaw 等 harness 包住,由後者管理多輪上下文、工具、子程序與外部環境。現有 SFT、RL 訓練堆疊多假設 rollout 可在訓練程序內同步產生,難以重現這類有狀態、多程序的實際執行路徑;研究者若另寫簡化代理,又會形成訓練與部署不一致。
OpenForgeRL 的核心是一層輕量代理伺服器:harness 仍照原方式發出模型請求,代理層把請求轉送至 veRL 等訓練系統的推論引擎,同時記錄提示、回覆與最終獎勵,再重建為可訓練軌跡。另一個 Kubernetes 編排器為每次 rollout 建立獨立遠端容器,負責環境配置、逾時及回收,藉此把代理執行與 GPU 訓練節點解耦。這套設計理論上能替換 harness、環境或 RL 演算法,而不必重寫完整代理。
作者以約 30B-A3B 的 MoE 模型訓練 OpenForgeClaw,在 ClawEval 得到 31.7 pass³、55.9 pass@3,QwenClawBench 為 33.7;8B 的 OpenForgeGUI 在 OSWorld-Verified、Online-Mind2Web 與 WebVoyager 分別取得 37.7、63.0、72.3。研究亦指出 RL 改善自我驗證、工具覆蓋與多步計畫完成率,錯誤復原仍是弱點。
工程價值在於它把「代理框架本身」納入後訓練分布,而不只訓練裸模型。不過目前數字均為作者自評,且 arXiv 頁面尚未提供可直接取得的正式程式庫、訓練資料或權重;容器失敗時丟棄不完整軌跡,也可能改變資料分布。接下來應觀察開源範圍、不同 harness 的可重現成本,以及隔離惡意工具與訓練憑證的安全設計。