AI research
One-Shot OPD 以單一查詢取得全資料蒸餾大部分增益,瓶頸轉向教師訊號吸收速度
研究者發現,學生模型反覆對一個查詢取樣並接受教師的 token 級監督,300 步後可覆蓋完整資料訓練所到達狀態的 71.5%。加入語意相異的 16 個查詢可把覆蓋率推至 98.9%,但結果仍限於指定的小型模型、教師與基準。

清華大學等研究者公開 One-Shot OPD,檢驗大型語言模型的 on-policy distillation 是否真的需要大量不同提示。OPD 讓學生模型先自行產生 rollout,再由凍結教師對學生實際走過的每個 token 狀態提供密集分布監督。因而「一個查詢」並不等於一筆固定訓練樣本:每步 64 次隨機 rollout、每個 token 前綴都會形成新的受監督狀態。
在數學設定中,單一查詢訓練 300 步後,跨 MATH-500、AMC 2023 與 AIME 2025 的平均分數為 68.5,完整 17,000 查詢資料為 69.8;前者取得完整 OPD 增益的 87%,並覆蓋後者所到達狀態的 71.5%。效應也出現在程式生成、指令遵循與代理工具使用,分別收回教師—學生差距的 73%、66% 與 64%。研究者再以 BGE-M3 語意分群選出不同查詢;每個領域 16 個查詢達到 98.9% 狀態覆蓋率,並在多教師 OPD 中匹配完整資料訓練。
論文把瓶頸描述為「資料過量、演算法飢餓」:不論使用 1、4、16 或全部查詢,每次更新消除剩餘師生分布差距的比例都隨訓練下降。即使固定重用最初的 64 條軌跡,對齊仍需數百步,顯示慢速不只是等待新狀態出現。這不代表任務資料已無用途;實驗依賴既定教師、模型家族與評測,OPD 的能力上限也受教師分布限制。公開 Apache-2.0 程式碼基於 veRL,重現參考配置需要單台八張 80GB H100 或 A100,且資料須由公開來源重建。下一步應檢驗更大模型、不同教師品質及資料縮減後是否出現未被現有基準捕捉的能力缺口。