返回首頁

代理強化學習

FlashREINFORCE 以單軌跡非同步更新取代代理 RL 的同題分組取樣

NVIDIA 研究團隊提出無 critic 的單 rollout 訓練法,讓長短不一的工具軌跡完成後即可進入更新。小模型實驗以一半 rollout 超越所列 GRPO 基線,但跨環境、跨規模的穩定性仍未得到充分驗證。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

長程代理的 rollout 可能卡在工具、模擬器或不同長度的推理鏈上;GRPO 等群組相對方法又要求同一提示產生多條軌跡後才能比較獎勵,容易形成同步屏障。9 月 14 日提交的 FlashREINFORCE 改為每個提示只取一條軌跡,完成的樣本立即進入非同步訓練。一個大小為 B 的批次因此可覆蓋 B 個不同提示,而不是把 rollout 預算花在同題的 sibling samples。[專案儲存庫](https://github.com/yifanzhang-pro/FlashREINFORCE)已提供 Apache 2.0 的 PyTorch 參考 loss、CPU 更新範例,以及基於 NVIDIA Molt 的推理、Python 工具與 ALFWorld 設定。

方法由三個元件穩定更新。One-Batch REINFORCE 用批次平均獎勵作 baseline,不需另訓 critic;token importance sampling 修正 rollout policy 與目前 policy 的機率差;Sequence Trust Region 則以序列級條件拒絕漂移過大的舊軌跡。最後,Sample-Mean Optimization 先在每條軌跡內平均 token loss,再對批次平均,避免很長的失敗回答僅因 token 多而獲得過大的負向權重。每批資料只更新一次後丟棄,也減少重複利用 stale samples 所造成的偏移。

[論文頁面](https://www.alphaxiv.org/abs/2609.flashreinforce-asynchronous-rl-agentic-models)報告,Qwen2.5-Math-1.5B 在五項數學評測平均達 38.0%,比所列 GRPO 基線高 1.7 個百分點,rollout 數為 25.6 萬對 51.2 萬;DeepSeek-R1-Distill-Qwen-1.5B 在約四次更新的 policy lag 下持續訓練 6,000 步。Qwen2.5-7B-Instruct 的 ALFWorld seen/unseen 成功率則為 98.3%/96.5%,並避免比較組停止呼叫工具的崩潰。

不過,importance sampling 只修正已觀察歷史上的 action,不能還原被舊 policy 改變的狀態分布;序列 trust 指標也只是取樣 action 上的 KL proxy。現有評測集中於數學、Python 工具及 ALFWorld,沒有 OSWorld 等更複雜環境,30B MoE 實驗主要證明訓練穩定而非全面品質優勢。工程團隊還應確認公開 launcher 能否重現論文曲線,而不能把附帶的 CPU toy example 當成完整復現。

來源

  1. FlashREINFORCE: Critic-Free Single-Rollout Asynchronous RL for Agentic Language Models
  2. FlashREINFORCE paper page