返回首頁

模型訓練與蒸餾

TIDE 修正教師—學生錯配,Qwen3 推理 Avg@8 由 6.9% 升至 20.3%

TIDE 不再把高 token 一致率直接視為蒸餾成功,而是分別處理學生過度生成及漏掉教師偏好 token 的問題。強錯配設定下,方法同時把平均回答長度縮短 3.6 倍,但重現完整訓練仍需八張 GPU,且作者未提供 checkpoint。

Aliharchick · CC BY-SA 4.0 · Image source
zh-Hant

8 月 10 日公開的 TIDE 指出,現行 on-policy distillation(OPD)存在「退化式一致」漏洞:學生模型進入重複迴圈後,教師也會在這段學生產生的前綴上預測相同續文,使局部 KL 距離趨近零,儘管整體答案已失去意義。論文的一個案例中,重複前綴令教師—學生 KL 降低 63 倍;訓練後含迴圈的 rollout 比例則由 16.8% 升至 48.4%。

研究者因此把錯配拆成兩個方向。對「學生過量」token,也就是學生給予高機率、教師幾乎拒絕的輸出,TIDE 以有界的 Hellinger shaping 取代可能無限增長的 log-ratio 懲罰,避免少數極端 token 主導梯度。對「學生缺額」token,方法直接檢查教師 top-K 分布並補回機率質量,不必等待學生以極低機率抽中;batch quantile gate 只保留錯配最嚴重的位置,已一致的 token 不參與 loss。

在 Qwen3 教師—學生配對與 AIME 2024、AIME 2025、AMC 2023 上,強錯配設定的 Avg@8 由標準 OPD 的 6.87% 提高至約 20.2%,平均輸出由 22,395 降至 7,294 token。這項結果說明,蒸餾監控若只看平均 KL 或 token agreement,可能把模型崩壞誤判為收斂。

程式已整合進作者維護的 verl fork,包含 CPU 單元測試、vLLM rollout 與規則式評分流程;不過預設配方需要八張 GPU、每題四條 rollout 及最長 7,168-token 回應。訓練 parquet、成品權重與完整執行紀錄未隨庫提供,且目前證據集中於小型數學推理模型。後續應觀察 TIDE 在程式碼、工具呼叫與較接近真實產品的教師—學生組合上,能否維持相同穩定性。

來源

  1. Mismatch Matters: On-Policy Distillation Beyond Token Agreement
  2. TIDE official implementation