模型訓練
u-OPSD 只靠模型內部投票訓練,Qwen3-8B 五項數學平均提高 10.7 分
u-OPSD 從同一模型的八條推理軌跡產生多數決偽解答,再把共識條件下的 token 分布蒸餾至分歧軌跡。Qwen3-8B 非思考模式的五項平均分由 43.57 升至 54.31,但錯誤共識與多次取樣成本仍限制其適用範圍。

研究團隊提出無監督在策略自我蒸餾 u-OPSD,嘗試移除推理模型後訓練所需的標準答案、外部獎勵與更強教師。方法對每道未標註題目取樣八條軌跡,解析其最終答案;若至少半數支持同一答案,就選擇最短的同意軌跡作為偽解答。相同但停止梯度的模型取得這份偽解答後,會在答案不同的軌跡前綴上產生完整詞彙分布,再以 forward KL 將逐 token 訊號蒸餾回學生。訓練因而集中於模型已有穩定傾向、卻仍會產生互相矛盾答案的題目。
作者使用 OpenThoughts 的三萬道題目,但只讀取題幹,以 LoRA 訓練 Qwen3。非思考模式下,Qwen3-4B 在 AIME 2024/2025、HMMT 2025、MATH500 與 AMC 2023 的平均分由 40.96 升至 49.49;8B 則由 43.57 升至 54.31。兩者分別高於使用標準解答的 OPSD 3.2 與 2.3 分。思考模式的優勢明顯縮小:8B 的 77.99 幾乎只追平 OPSD 的 77.97。實驗也顯示只比對學生實際取樣的 token 會丟失大量訊號,top-100 或完整詞彙分布較有效,但推論與訓練成本更高。
這項結果意味著,工程團隊或可用大量未標註、答案格式固定的題庫擴充後訓練,而不必先建立驗證器。不過它尚不是通用的「模型自行變聰明」配方:實驗只涵蓋 Qwen3 與競賽數學,並依賴可抽取、可正規化的短答案。抽查中仍有 13.3% 偽標籤錯誤,而且作者尚未提供所有設定的多隨機種子誤差。下一步應觀察開放式任務能否建立可靠的軟共識,以及反覆自蒸餾會否放大模型原有偏誤。