返回首頁

模型訓練

ReflectRL 把專家錯誤軌跡變成訓練訊號,GRPO 跨域評測平均提高 19.1 點

ReflectRL 不再丟棄強模型答錯的推理軌跡,而是要求學生模型找出局部錯誤,再逐步撤除這項提示。研究在九項基準上報告穩定提升,但成果主要來自數學推理設定,專案所列 GitHub 連結目前亦無法存取。

Kuebi · CC BY-SA 3.0 · Image source
zh-Hant

大型語言模型的 on-policy 後訓練通常只保留專家模型答對的「黃金軌跡」;遇到難題時,專家若答錯,整段推理往往被當成負樣本丟棄。ReflectRL 主張這些軌跡仍含有長段正確前綴,錯誤通常集中在少數步驟,因此學生模型從既有推理中定位並修正錯誤,可能比從零解題更容易。

系統把這類資料稱為 Golden Negative Trajectories(GNT)。在 RLVR 設定中,每組 rollout 同時包含直接作答與「閱讀錯誤軌跡後反思」兩種輸入,沿用原有驗證器及 GRPO、DAPO 等目標,不增加額外 loss。訓練期間再以餘弦排程逐步降低反思樣本比例,最後只留下直接作答,避免推論時依賴外部專家軌跡。用於 on-policy distillation 時,GNT 只提供給教師端,學生仍從原始問題產生 token。

研究釋出含 6.9 萬條專家失敗軌跡的 OpenR1-GNT-69k,並測試四種模型骨幹、四種訓練方法與九項基準。以 Qwen2.5-Math-7B 為例,GRPO 加入 ReflectRL 後,六項同分布測試平均由 37.0 升至 42.4;ARC-c、GPQA 與 MMLU-Pro 的跨域平均由 20.9 升至 40.0。DAPO 與 3B 學生的 OPD 實驗也呈現提升。

工程上值得關注的是:方法改變的是 rollout 配置,而非推論介面,可望接入既有 RLVR 管線。不過數字均由作者自報,主要訓練領域仍是可自動驗證的數學題;跨域躍升是否來自真正可轉移的推理能力、資料重疊或基準特性,仍需獨立重現。論文列出的 GitHub 專案目前回傳 404,雖有 Hugging Face 權重與資料頁面,完整訓練程式的可重現性仍待確認。

來源

  1. ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning
  2. ReflectRL-Qwen2.5-Math-7B-GRPO-ReflectRL