返回首頁

代理強化學習

Agent Lightning v1.0 讓真實代理框架直接參與強化學習,Qwen3.5-9B 的 SWE-bench Verified 升至 56.4%

Microsoft 重寫 Agent Lightning,以模型 API 代理層擷取既有代理框架的完整互動,不必把工具迴圈搬入訓練引擎。官方以 6,000 筆資料訓練 Qwen3.5-9B,報告 SWE-bench Verified 由 41.8% 提升至 56.4%。

Cpl Daniel Wiepen · OGL v1.0 · Image source
zh-Hant

Microsoft 與多所大學研究者發布 Agent Lightning v1.0,把「部署時真正使用的代理框架」納入模型強化學習,而不是在訓練器內另寫一套簡化環境。新版約有 3,500 行程式碼,由 Trainer、API Gateway 與 Rollout Controller 組成:Gateway 代理模型端點並記錄請求與回應,Controller 在本機或 Kubernetes Job 中執行原有代理,Trainer 則透過 verl、vLLM 整理軌跡及更新策略。工具、上下文壓縮和控制流程仍由 OpenHands 等框架掌管。

這種分離架構的難點是,一次代理執行會形成數量不定的模型呼叫;重新序列化或壓縮上下文也可能破壞 token 前綴連續性。論文因此把 advantage 計算和 loss normalization 從個別訓練樣本提升至完整 rollout 層級。最佳設定的驗證獎勵達 38.2%,高於 sample-level 基線的 35.0%,策略熵亦較穩定。

程式代理實驗先清理 SWE-smith:59,136 筆紀錄中有 18,033 筆沒有問題描述,另移除缺少分支或測試超過 200 項的任務,再以模型成功率篩成約 6,000 筆。為防止代理直接取得答案,環境隱藏 `.git`、禁用 Git 指令,並以 Kubernetes 網路政策阻擋任意外連。最終 Qwen3.5-9B 在 SWE-bench Verified 由 41.8% 升至 56.4%。

工程價值不只在分數,而是提供可重現的框架,研究 retokenization、軌跡合併和非同步排程如何改變 RL。下一步仍須確認增益能否跨模型、代理框架及不同程式語言重現;目前結果也不代表單純換上此框架便可獲得相同提升。

來源

  1. Agent Lightning v1.0: Towards Harnessed Agentic RL
  2. microsoft/agent-lightning