返回首頁

AI 評測與安全

凍結的 Qwen3-8B 也會產生「能力擴張」,研究要求自我改進評測加入實測虛無基線

新研究發現,單次貪婪解碼與不穩定門檻可讓完全未訓練的模型看似獲得或失去能力。改用逐題精確檢定後,三種自我訓練只穩定強化既有能力,未能證明取得基礎模型從未觸及的新能力。

NASA's James Webb Space Telescope · CC BY 2.0 · Image source
zh-Hant

判斷模型是否「自我改進」,不能只比較訓練前後的平均正確率;近期研究常進一步追蹤每一道題是否由錯轉對或由對轉錯。然而,這種逐題轉移其實是兩次含噪估計的差值。都柏林大學等研究者以 Qwen3-8B、三輪 rank-32 LoRA 訓練及完全凍結的控制模型重跑相同管線,辨認出七種足以翻轉結論的量測失敗。

最直接的問題是,temperature 0 並不保證批次推論逐位元確定。凍結模型與自己比較時,單次貪婪解碼仍製造出六道「新學會」及九道「被破壞」的題目;即使把請求序列化,仍有約 2% 判定翻轉。另一個常用的 expansion rate,把基礎模型在 128 次抽樣皆失敗、訓練後至少成功一次視為能力擴張,竟令未訓練模型得到 0.280。把成功門檻提高也沒有根治問題:110 組凍結比較所量得的虛無值仍為 0.058,95% 區間為 0.038 至 0.078。

團隊改以每題的精確檢定,比較訓練模型與匯集多次獨立評估所得的基線,再控制 false discovery rate。這套方法在所有留出凍結副本上均未檢出變化。套用至三種自我訓練與外部教師蒸餾後,教師可改善基礎模型極少答對的 22 道題中的 8 至 11 道;自我訓練只改善 0 至 2 道。對基礎模型在抽樣中從未答對的十題,統計證據仍不足。

這不表示自我訓練毫無價值:所有七個訓練臂中,後來達到 pass@1 的題目,基礎模型早已在 128 次抽樣中至少答對一次,說明方法能把低機率正解「銳化」成穩定輸出。但它也可能破壞既有題目,且截斷率、批次配置與訓練種子都會偽裝成能力變化。未來評測應保留多個 checkpoint 0 副本、逐題重複抽樣,並為每項轉移統計分別報告實測噪音底線。

來源

  1. Phantom Gains: Auditing Self-Improvement Against a Measured Null
  2. phantom-gains: Code and Evaluation Artifacts