返回首頁

模型推論

SVR 讓 2B 模型自行判斷何時停止修訂,平均 2.99 輪完成數學推理

SVR 同時訓練答案、正誤判決與信心,使模型在推論時自行決定保留答案或繼續修正。Qwen3.5-2B 在七項數學基準取得 56.3% 平均準確率,但停止訊號仍可能受模型自身的校準偏差影響。

Alex Saveliev from Russia · CC BY-SA 2.0 · Image source
zh-Hant

增加測試時計算通常採固定採樣或固定修訂輪數,容易在簡單題目浪費 token;依賴外部驗證器又會增加模型、延遲與維運成本。Self-Verifying Refinement(SVR)嘗試讓同一模型兼任解題者與停止控制器:每一輪除答案外,也輸出離散的 Correct/Incorrect 判決和信心分數。只有模型判為正確且信心超過門檻時,系統才保留目前答案並停止,否則把自我檢查結果送入下一輪修訂。

訓練採固定長度軌跡與 GRPO。獎勵同時衡量答案正確性、正誤判決是否可靠、信心校準,以及模型能否抵達適合停止的正確狀態。標準答案只用於建立訓練獎勵,不會出現在修訂提示中;部署時也不需要 oracle 或另一款 reward model。換言之,SVR 學到的不只是「再想一次」,還包括何時繼續計算才有預期收益。

研究在 Qwen3.5-2B 上測試 AIME、AMC、MATH-500 等七項數學推理基準。SVR 的 macro-average 準確率為 0.563,每題平均執行 2.99 輪;論文宣稱它勝過標準 GRPO、多輪修訂基線及固定十輪方案,同時使用顯著較少輪數。這對批次推論服務很實用,因為不同請求可依難度消耗不同預算,而不必一律支付最壞情況成本。

不過,內部驗證不是免費的真值來源。模型可能以高信心保留錯誤答案,也可能反覆否決正確答案;數學題具有可驗證訓練訊號,結果未必能直接外推至程式修改、開放式問答或代理操作。論文目前亦未提供可重現程式與權重。工程團隊接下來應關注信心門檻在分布外資料上的穩定度、實際 token/延遲而不只是輪數,以及錯誤停止能否由低成本外部檢查器補強。

來源

  1. SVR: Self-Verifying Refinement via Joint Verdict–Confidence Reinforcement Learning for Adaptive Test-Time Compute
  2. Qwen3.5-2B 模型頁面