返回首頁

模型訓練與推理

DASH 依推理軌跡動態分配蒸餾權重,Qwen3 三種規模皆優於固定權重基線

DASH 不再等量處理每個 token 的教師—學生差異,而是依整條生成軌跡調整監督可向前傳播的距離。作者在三項數學基準報告穩定增益,並公開訓練程式、評測流程與 LoRA 權重。

Apteva · CC0 · Image source
zh-Hant

8 月 6 日公開的 DASH,試圖修補 on-policy self-distillation(OPSD)的一項時間結構問題。這類方法讓學生先生成推理軌跡,再由取得參考解答等特權資訊的教師,在學生實際走過的每個 prefix 上提供 token 分布;標準 OPSD 卻以近乎固定的係數聚合各位置的 KL 差異,無法區分「相同局部偏差、後續卻走向不同結果」的情況。

DASH 先截斷每個詞彙項目的局部前向 KL 貢獻,再比較該位置訊號與整條序列平均值的差距。這個差距經 sigmoid 轉成停止梯度的傳播 gate,透過由後向前的遞迴聚合,決定後續差異應在多長的 supervision horizon 內影響目前權重。低於平均的局部差異會打開較長 horizon,高於平均者則縮短傳播。因教師與學生分布本來就是 OPSD 所需輸出,作者表示方法不用增加模型 forward pass,額外 step time 低於 1%。

研究以 Qwen3-1.7B、4B 與 8B,在 AIME 2024、AIME 2025、HMMT 2025 進行 Avg@12 評測。相對配對重跑的標準 OPSD,DASH 的三項平均分分別由 41.87 升至 45.07、63.60 升至 65.00、64.80 升至 66.40,九個「模型規模×基準」組合全部領先。儲存庫提供完整訓練與評測程式、三款 LoRA adapter、固定套件版本及硬體配置;報告中的主要訓練使用最多八張 A800 80GB GPU。

工程上的意義是,密集蒸餾訊號不必只做逐 token 模仿,也能低成本納入軌跡歷史。不過結果目前限於數學推理、Qwen3 與單一主要訓練 seed;README 也明示 vLLM 取樣及 bf16 reduction 並非位元確定。下一步應觀察多 seed 重現、程式與工具代理能否受益,以及 privileged reference 不完整或錯誤時,路徑相依權重會否放大教師偏差。

來源

  1. DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
  2. DASH-OPSD repository
  3. DASH Qwen3-1.7B LoRA adapter