返回首頁

模型後訓練研究

BPCO 以單一 rollout 訓練 LLM critic,取代 GRPO 的多回應組內比較

BPCO 結合受限 value head、Monte Carlo target 與長度自適應 GAE,讓 critic 從單一回應估計逐 token advantage。作者在 1.5B 至 30B-A3B 模型上追平或超越多樣本方法,但尚未證明整體訓練成本較低。

Jason86188 · CC BY-SA 4.0 · Image source
zh-Hant

新加坡國立大學研究團隊提出 Best-Practice Critic Optimization(BPCO),重新檢視 LLM 強化學習近年偏向 GRPO 等無 critic 方法的原因。GRPO 對同一提示生成多個回應,再以組內相對獎勵估計 advantage;它省去 value model,代價是每個提示需要多次 rollout,而且通常把同一結果訊號套到整段回應。BPCO 則訓練 critic 估計每個回應前綴的期望回報,只採樣一個回應便能建立逐 token 訊號。[論文](https://arxiv.org/abs/2608.23566)沒有提出單一新損失函數,而是把數個容易失配的設計組成完整配方:以 DPPO 約束被採樣 token 的絕對機率變化;透過縮放 arctangent 把 value prediction 限制在已知獎勵範圍;用最終觀測結果作為無偏 Monte Carlo critic target;取消 batch advantage normalization,避免接近收斂時把微小雜訊重新放大;並依回應長度調整 GAE,降低終點獎勵對長短序列產生不同衰減。critic 只在訓練期使用,因此還能讀取不提供給 policy 的標準答案、解題過程或評分 rubric,協助估計 value 而不改變部署輸入。作者在 DeepScaleR 40.3K 題、DAPO-Math-17K、OpenRubrics,以及 DeepSeek-R1-Distill-Qwen-1.5B 與 Qwen3-30B-A3B 系列上測試;結果顯示 BPCO 持續優於其 critic baseline,並以每個提示一個回應追平或超過採樣多個回應的 group baseline。團隊也已公開基於 verl 的[訓練程式與執行腳本](https://github.com/QPHutu/golden_critic),涵蓋數學、MoE 與 rubric 實驗。不過「單 rollout」只代表較少生成軌跡,critic 本身仍增加參數、forward pass、activation、optimizer state 與記憶體,論文沒有提供完整 wall-clock、GPU 時數或峰值記憶體對照。證據也集中於獎勵範圍已知的數學與 rubric 任務;privileged input 在小資料情境可能更快過擬合。接下來最值得驗證的是代理工具使用、程式任務及含噪或非定界獎勵下,這套配方是否仍比 GRPO 更穩定且真正節省總成本。

來源

  1. How to Train a Critic Stably and Efficiently
  2. QPHutu/golden_critic