返回首頁

模型訓練與推論效率

三段式自路由讓 1.5B 推理模型在 MATH-500 減少 41% 輸出 token

新研究把 NoThink、Short 與 Long 變成模型生成的首個 token,毋須另設路由器即可逐題分配推理預算。方法在 MATH-500 維持接近基礎模型的準確率,並在較簡單的 GSM8K 減少 76% token。

Rufus Sarsaparilla on wikipédia en · Public domain · Image source
zh-Hant

研究團隊在 [DeepSeek-R1-Distill-Qwen-1.5B](https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B) 上加入三段式自路由:模型收到題目後,先生成 `NoThink`、`Short` 或 `Long`,再依模式使用最多 1,024、3,000 或不設固定上限的輸出預算。這個選擇與主模型一起由 GRPO 更新,沒有獨立分類器;為避免策略迅速塌縮至單一模式,訓練還加入強制探索暖身、模式比例平衡項,以及不同長度區間的獎勵曲線。

[論文](https://arxiv.org/abs/2608.20256)以 MATH-lightEval 訓練,使用四張 H100 跑 90 個更新步驟並重複三個隨機種子。MATH-500 上,自路由模型準確率為 0.782,略低於未訓練基線的 0.796;平均輸出則由 4,743 降至 2,810 token,減少 41%。零樣本轉移至 [GSM8K](https://github.com/openai/grade-school-math) 時,平均長度由 1,930 降至 459 token,準確率由 0.831 降至 0.781;在較困難的 AIME 2024/2025,模型大多選擇 Long,token 僅減少約 13%。這表示收益主要來自辨識不值得長考的題目,而非提高解題上限。

工程上的重點是:推理預算可以成為策略本身的離散動作,省去先跑一次難度預測器的額外延遲。但目前證據只涵蓋單一 1.5B 模型與數學任務,模式上限亦按該資料的長度分布設定;論文還承認未套用上限的驗證方式可能高估短模式準確率。下一步應觀察程式碼、工具代理等長度需求更不規則的任務能否保持同樣路由穩定性,以及實際 GPU 延遲與吞吐是否按 token 降幅改善。

來源

  1. Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation
  2. DeepSeek-R1-Distill-Qwen-1.5B model card
  3. GSM8K: Grade School Math Dataset