返回首頁

AI 研究

RISE 從 RLVR 更新方向合成逐 token 教師,免用外部大模型蒸餾

Salesforce AI Research 團隊把目前模型與落後錨點之間的更新位移向前外推,合成會隨訓練更新的「未來策略」教師。方法在數學與代理基準勝過純 GRPO,但增加 1.3 至 1.6 倍牆鐘時間,且依賴訓練軌跡局部近似線性的假設。

Stephen Horncastle · CC BY-SA 2.0 · Image source
zh-Hant

9 月 4 日提交的 RISE 研究,試圖解決 RLVR 只有整段答案獎勵、難以判斷哪些 token 真正有用的信用分配問題。其做法先以 GRPO 等策略梯度完成一次可驗證獎勵更新,再比較更新後 checkpoint 與先前或 EMA 錨點的差值;研究者把這個位移乘上大於一的係數,在權重空間或 logit 空間外推成「未來策略」,並將其完整 token 分布蒸餾回目前模型。教師每輪重新生成,因此不需要外部強模型或帶正解的特權上下文。

兩種實作有不同成本。權重版必須實體化外推後的參數,並在蒸餾步驟額外執行教師 forward pass;logit 版則對錨點與更新後模型的對數機率做幾何混合,快取 top-100 token 加尾端機率桶。兩者重用 RLVR 已產生的 rollout,沒有額外取樣成本,但整體牆鐘時間仍是純 RLVR 的 1.3 至 1.6 倍。外推係數會逐步衰減至一,以降低訓練接近收斂時越過最佳點的風險。

作者在 1.7B 至 8B 的 Qwen、OLMo 模型上測試數學、STEM、程式與代理任務。OLMo3-7B 的 AIME 2024 準確率由 GRPO 的 30.2%升至 logit 版的 46.9%;Qwen2.5-3B 的權重版在 ALFWorld 成功率由 75.0%升至 84.4%,WebShop 準確率由 63.3%升至 74.2%。三個隨機種子的數學實驗亦維持增益。

但「未來教師」不會自行判斷更新方向是否正確;若獎勵函式有漏洞,外推可能放大錯誤。論文觀察三個方向可解釋約 87%的訓練軌跡變異,仍不足以保證其他模型、長期訓練或非可驗證任務保持線性。現階段結果來自作者控制的中小型模型與既有基準,尚需獨立重現、獎勵錯置壓力測試,以及與同等總算力的更強 RLVR 配方比較。

來源

  1. RISE: Recursive Improvement via Self-Extrapolating Policy Distillation
  2. RISE paper page and community discussion