返回首頁

AI 研究與訓練

VIGOR 依獎勵變異動態分配 RLVR rollout,數學推理訓練最多減少 2.3 倍採樣

新研究不再替每道題固定生成相同數量的推理軌跡,而是把額外運算集中到獎勵分歧較大的樣本。作者在數學與程式任務上報告更高的 rollout 效率,但尚未公開程式碼,實際 GPU 時間與大模型擴展性仍待驗證。

MontdErve · Public domain · Image source
zh-Hant

強化學習搭配可驗證獎勵(RLVR)已成為訓練推理模型的重要路徑,但常用的 GRPO 會對同一批每個問題生成固定數量的回答,再以群組內相對獎勵估計梯度。這種配置容易把大量 token 花在「全部答對」或「全部答錯」的樣本上;其群組獎勵幾乎沒有變異,能提供的學習訊號有限。

加州大學洛杉磯分校研究者提出 VIGOR(Variance-Guided Online Rollout Allocation),先為批次內所有問題產生少量 rollout,再計算各題的群組獎勵變異。剩餘預算會逐輪分配給變異最高、模型仍處於決策邊界附近的題目,而不是平均增加樣本。這項操作在當前批次內完成,不必維護跨步驟的歷史難度估計,也不需要先生成大型候選池再丟棄結果。

作者從 RLVR 梯度推導出獎勵變異與梯度量級的關係,並在變異服從 Pareto 分布的假設下分析相對於固定配置的理論加速。實驗以 Qwen2.5-3B 訓練數學推理、以 Qwen3-8B測試 LiveCodeBench v6:VIGOR 達到指定數學準確率所需 rollout 最多減少 2.3 倍;程式任務達到 GRPO 最終 full-pass rate 時少用 1.49 倍 rollout,平均測試通過率則提高 3.4 個百分點。結果使用三個隨機種子,但「rollout 較少」不必然等於同幅度的端到端節省,因為逐輪配置、同步與變長生成也會產生開銷。

工程團隊下一步應關注 wall-clock 時間、總生成 token、GPU 利用率,以及在稀疏或帶雜訊獎勵下是否仍穩定。論文目前也沒有附上可重現程式庫;在更大模型、非二元評分及不可精確驗證的代理任務上,變異是否仍是可靠的採樣依據尚未得到證明。

來源

  1. Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning
  2. DOI record for arXiv:2607.22002