返回首頁

代理強化學習

SAPO 讓單一自回歸模型兼任 actor 與 critic,代理 RL 每輪訓練快 33.2%

SAPO 利用生成序列的兩個因果邊界,同時讀出狀態值與動作值,毋須獨立 critic 或同題多次 rollout。Qwen2.5-7B 在 ALFWorld 與 WebShop 的整體指標皆勝過 PPO、GRPO,但目前仍缺少公開實作驗證。

Stefan Freidel · CC BY 2.5 · Image source
zh-Hant

代理強化學習通常在兩種成本間取捨:PPO 能用 critic 做逐回合信用分配,卻要維護另一套接近 policy 規模的模型;GRPO 省掉 critic,但須為同一提示產生多條軌跡,遇到長流程、稀疏回報或整組結果相同時,優勢值可能歸零。8 月 20 日公開的 SAPO 嘗試把兩者合併成單一自回歸模型。

SAPO 在每輪代理輸出的兩個因果邊界讀取價值:動作生成前估計 V(s),完整動作生成後估計 Q(s,a)。研究者保留詞彙表中的兩個 token,以其 logit 差映射成有界標量;這兩個 token 不會被解碼或送入環境。模型只為每項任務採樣一條軌跡,再以 λ-return、廣義優勢估計及跨 batch 的回合級正規化,把終局回報反傳至較早決策;policy、V 與 Q 的損失則在同一次反向傳播更新共享骨幹。

以 Qwen2.5-1.5B 與 7B、三個隨機種子測試時,SAPO 相對 PPO、GRPO 的平均提升分別為 15.1 與 12.1 個百分點。7B 版本在 ALFWorld 整體成功率達 94.0%,WebShop 分數與成功率為 88.6%及 82.4%;相同設定下,PPO 的三項數字為 80.4%、81.4%及 68.7%。在 1.5B 的 ALFWorld 測試中,每輪時間由 PPO 的 451.2 秒降至 301.4 秒,主要來自較少軌跡生成及移除 critic 推論、更新路徑。

這項設計對長流程工具代理很有吸引力,因為它把價值估計放回因果語言模型本身,而非另接 value head 或第二模型。不過速度量測只涵蓋一款模型與一個環境,訓練亦使用 4 張 H200 加 8 張 A40;論文尚未提供程式碼,無法確認記憶體節省、保留 token 的穩定性或在更大模型上的 policy–value 干擾。下一步應觀察獨立重現,以及它能否移植至搜尋、程式執行等回報更不規則的環境。

來源

  1. SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning
  2. WebShop:可擴展的真實資料網頁互動環境