返回首頁

模型訓練

DASH 依推理分歧動態分配蒸餾權重,Qwen3-1.7B 數學平均提高 3.2 分

DASH 不再等量處理每個 token 的師生差異,而是根據整段推理中的分歧變化調整監督範圍。三種 Qwen3 規模均優於同條件 OPSD,但最佳 checkpoint 由測試基準平均分挑選,可能高估泛化增益。

Apteva · CC0 · Image source
zh-Hant

可驗證獎勵強化學習通常只在答案完成後給出成敗訊號;on-policy self-distillation(OPSD)則讓學生模型產生推理軌跡,再由同一模型在額外取得參考解答後充當教師,於學生實際走過的每個 prefix 提供 token 級分布。問題是標準 OPSD 將各位置的 KL divergence 等權平均,沒有區分分歧正在擴大、收斂或只是暫時波動。

[DASH 論文](https://arxiv.org/abs/2608.06243)把每個位置的分歧與該序列平均值比較,經 sigmoid 轉成 propagation gate,再由序列尾端向前遞迴聚合。低於平均的分歧會開啟較長監督範圍,高分歧位置則縮短傳播;gate 採 stop-gradient,因此只重新配置既有蒸餾梯度,不另增教師或學生 forward pass。[公開實作](https://github.com/DBtxy/DASH-OPSD)稱額外 step time 低於 1%,並提供 Qwen3-1.7B、4B、8B 的 LoRA adapter。

團隊在 AIME 2024、AIME 2025 與 HMMT 2025 以 Avg@12 評估。相較自行重跑的 OPSD,三項宏平均由 41.87、63.60、64.80 分別升至 45.07、65.00、66.40;九個模型—基準組合全部較高。工程上的吸引力是它可疊加在已計算完整教師詞彙分布的 OPSD 管線,不需要額外推論,但這個前提本身仍相當昂貴。

結果也有明顯邊界:實驗只涵蓋 Qwen3 與數學題;每種方法訓練 200 steps,並直接以三個報告基準的平均分選取最佳 checkpoint,而非使用獨立驗證集。接下來應觀察固定訓練終點、程式碼或代理長軌跡是否仍有增益,以及動態權重會否放大教師在錯誤參考解答上的偏差。

來源

  1. DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
  2. DASH-OPSD implementation and released adapters
  3. Qwen3-4B model card