返回首頁

模型訓練與推理

TTPO 用多數決分流正負軌跡,讓模型在無答案測試題上即時更新

TTPO 不把多數決答案直接當真,而是蒸餾與共識一致的軌跡,再以群組強化學習懲罰高信心的分歧錯誤。作者報告 Qwen3-1.7B 在三項數學競賽的 Avg@12 由 38.0 升至 45.2,但這仍是直接使用測試題更新參數的轉導式設定。

xiquinhosilva · CC BY 4.0 · Image source
zh-Hant

浙江大學與阿里巴巴研究團隊提出 Test-Time Policy Optimization(TTPO),試圖在沒有標準答案的測試階段,直接利用模型自己的多條解題軌跡更新策略。一般自我訓練會把多數決結果當成偽標籤;難題上若多數答案本身錯誤,蒸餾便會把錯誤擴散至整條推理鏈。TTPO 的核心觀察是訊號具有不對稱性:即使多數決錯了,與它分歧的軌跡通常也不是正解,因此仍可作為較可靠的負面訊號。

每道題先抽樣 K 條軌跡,按最終答案聚類。與最大群組一致的軌跡進入 on-policy self-distillation 分支,以 forward KL 傳遞逐 token 訊號,並降低已收斂位置的權重;分歧軌跡則進入 grouped RL 分支,只懲罰模型高度確信的錯誤 token,避免把局部合理步驟一併抹除。多數決在這裡只負責路由,不被假定為真實答案。

作者在 AIME25/26、HMMT25/26 與 BRUMO25 上報告,無標籤 TTPO 的 Avg@12 在 Qwen3 1.7B、4B、8B 分別達 40.1、58.6、62.6,追平或略高於使用答案監督的 OPSD。純 test-time training 中,1.7B 模型在三項測試由 38.0 升至 45.2;4B 的 61.1 亦略高於未更新 8B 的 60.7。程式碼提供 LoRA、vLLM 及四 GPU 腳本。

限制是評測採 Avg@12,額外 rollout 與更新成本不能與單次推論直接比較;而在測試題本身訓練屬轉導式適應,不代表面對全新分布仍有同等收益。跨競賽遷移提供初步證據,但目前任務集中於可抽取短答案的數學題。工程團隊應進一步觀察錯誤共識會否在開放式任務累積,以及線上更新的回滾、隔離與成本控制。

來源

  1. TTPO: Test-Time Policy Optimization
  2. TTPO Project Page
  3. ZJU-REAL/TTPO