返回首頁

模型後訓練

Open-MOPD 重配多教師蒸餾的 token 預算,能力整合率由 35.6% 升至 83.4%

Open-MOPD 發現,多教師在線策略蒸餾的主要瓶頸並非教師梯度衝突,而是不同領域分到的有效 token 更新量嚴重失衡。它結合 token 份額平衡、差距導向配置與學生回報刷新,在單一 3B 模型中追回 83.4% 的可用能力增益。

Robin Lin · CC BY-SA 3.0 · Image source
zh-Hant

多教師在線策略蒸餾(M-OPD)讓學生模型自行產生回答,再由數學、程式與指令遵循教師,對各領域的學生 token 提供密集監督,目標是把多個 RL 專家的能力合併到一個可部署模型。Open-MOPD 以 SmolLM3-3B-Base 建立完整開放實驗:先做混合領域 SFT,再分別訓練三個 RL 教師,最後使用已知領域標籤進行完美路由,藉此排除路由器錯誤。

即使路由完全正確,樸素 M-OPD 的六項評測總分仍只有 28.05,低於分領域部署的 RouteOPD 31.55;相對混合 SFT 與 RouteRL 之間的增益,它只追回 35.6%。問題集中於短輸出的指令遵循任務:這類資料佔 20.3% 提示,卻僅產生 0.99% 梯度 token。由於損失按 token 聚合,長篇數學與程式回答自然取得更多更新預算;各領域收斂速度不同又會令回報幅度逐步漂移,重複使用同一批 rollout 則使依賴學生機率的回報過期。

Open-MOPD 對應加入三項機制。token-share balancing 直接控制各領域的梯度 token 份額;gap-aware allocation 把後續預算轉向仍與教師差距較大的領域;reward refresh 在每次梯度步驟前重算學生 log probability,同時快取教師狀態以降低額外成本。完整方法把總分推至 31.24,能力增益回收率升至 83.4%,接近需維持三個學生的 RouteOPD。

這項結果提醒後訓練工程師:平衡提示數量並不等於平衡最佳化訊號,尤其當不同任務的輸出長度相差數十倍。限制是研究只使用一個 3B 底模、三個領域與 oracle 路由,評測亦採每領域不同的抽樣次數。真正部署仍須驗證自動路由、較大 MoE 模型及更多相互重疊能力下,這套預算控制是否保持穩定。

來源

  1. Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation
  2. Open-MOPD Project Page