返回首頁

模型訓練

演化策略後訓練保留更多推理路徑,Pass@32 平均優於 GRPO

新研究以參數擾動和純前向評估訓練推理模型,發現演化策略可減輕 GRPO 的熵崩塌與大樣本覆蓋下降。結果涵蓋 1.5B 至 7B 模型,但訓練規模、任務範圍與可重現性仍有限。

U.S. Government Accountability Office · Public domain · Image source
zh-Hant

來自南方科技大學、新加坡國立大學、華為諾亞方舟實驗室等機構的研究,重新評估演化策略(Evolution Strategies,ES)作為 LLM 推理後訓練方法。GRPO 會從同一策略取樣多個回答,依相對獎勵建立 token 級梯度;ES 則對整個模型參數加入高斯擾動,只執行前向 rollout,再把各擾動方向按標準化獎勵加權合成更新。它不需保存反向傳播狀態,記憶體需求較低,也容易把族群成員分散到多個運算節點。

作者關注的不只是 Pass@1,而是重複取樣能否找到至少一個正解的 Pass@K。實驗以 Qwen2.5-1.5B、Llama-3.2-3B、Qwen2.5-7B 在 GSM8K 後訓練,另以 DeepSeek-R1-Distill-Qwen-1.5B 在 DeepScaleR 訓練。GRPO 的單次正確率通常提升較多,卻在簡單設定的 18 組 Pass@16/Pass@32 比較中有 15 組低於原始模型;ES 的熵變化較小,兩種設定的平均 Pass@1、Pass@16 與 Pass@32均高於基線。

困難數學設定最能顯示取捨:GRPO 的四項平均 Pass@1/16/32 為 52.9/74.7/78.0,ES 為 49.9/75.0/78.9。將 ES 與 GRPO 各使用一半更新預算並依序訓練後,ES→GRPO 得到 52.3/75.8/79.2,在保留多數單次增益時提高 Pass@32。論文把這種現象歸因於參數擾動產生的策略族群多樣性,並用 verifier-projected Jensen–Shannon diversity 說明其與重複取樣覆蓋率的關係。

研究也發現 ES 的整體參數漂移量是 GRPO 的 40.7 至 44.1 倍,但有效增益集中於少量較大更新,不能只憑權重距離判定災難性遺忘。對工程團隊而言,ES 較適合需要候選解多樣性、搜尋或 majority voting 的場景,未必適合只服務一次解碼的產品。現有證據僅涵蓋四個最高 7B 的模型、數學與少數問答/程式基準;論文所列程式庫在查核時仍無法公開存取,計算成本與跨團隊重現性尚待驗證。

來源

  1. Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
  2. Understanding Evolution Strategies for LLM Reasoning — Paper page