模型訓練與對齊
RRC 將生成式獎勵模型的排序轉成 GRPO 訊號,AlpacaEval 2 得分由 35.8% 升至 41.3%
RRC 不再把偏好 token 的機率直接當獎勵,而是從候選答案的相對排序建構分數。8B 獎勵模型配合八次投票時,ArenaHardV2 亦由 8.0% 提高至 11.2%,但代價是額外的獎勵模型推論。

生成式獎勵模型可以先推理再比較兩個答案,卻常被 RL 管線壓縮成單一偏好 token 的機率。新提出的 Ranking-based Reward Construction(RRC)指出,這會把模型的比較能力塞進不合適的絕對分數介面:思維鏈往往令最後的 A/B 機率飽和,而信心也不必然等於答案品質。研究中的點式生成獎勵模型有 88.3% 樣本落在 0–0.1 或 0.9–1.0,真正位於中間區間的只有 11.7%。
RRC 保留 GRPO 所需的純量輸出,但改變其來源。Self-Competitive Ranking 讓同一提示的多個 rollout 互相比較,按勝場產生獎勵;若比較形成 A 勝 B、B 勝 C、C 又勝 A 的循環,便以加權圖與近似 Kemeny 聚合整理成一致次序。Anchor-Guided Ranking 則先由固定參考策略產生少量錨點,每個候選只需計算勝過多少錨點,避免全面互比。多次抽樣後的多數決還可用推論預算換取較穩定的偏好判斷。
作者以 Llama 3.1 8B 作為政策模型,使用 3B、8B 生成式獎勵模型及 7,500 筆 RL 資料。8B 獎勵模型的機率基線在 AlpacaEval 2、ArenaHardV2 與 MMLU-Redux 分別取得 35.8%、8.0% 與 52.9%;錨點排序加 voting@8 後為 41.3%、11.2% 與 56.9%。近似等算力的機率聚合仍落後,支持增益不只是增加推論次數。
公開程式以 MS-SWIFT 外掛接入 GRPO,獎勵模型經 OpenAI 相容 API 服務,並提供 vLLM 多埠部署範例。工程端仍須留意成本:成對比較、投票和錨點都增加推論呼叫;儲存庫目前只有初期提交,未附作者實驗所用獎勵模型權重,README 的 clone 指令亦仍是佔位字串。下一步應觀察獨立重現、較大 rollout 群組,以及排序模型偏誤是否會在長期訓練中被政策放大。