模型訓練與最佳化
Muon 加速 grokking 後仍會失效:九組設定全數出現泛化崩落
新實驗發現,以 Muon 訓練 Transformer 隱藏矩陣、AdamW 更新嵌入與輸出頭時,模型雖較快學會模運算,卻無法穩定維持解法。凍結任一參數群可阻止崩落,顯示問題源於表徵與讀出介面的共同漂移。

Muon 會先正交化動量更新,近年常被用於 Transformer 的隱藏權重矩陣,嵌入層與輸出頭則交給 AdamW。新研究在無正規化層的 decoder-only Transformer 上測試 `(a+b) mod 113`,確認這種分工能較快跨過 95% 測試準確率的 grokking 門檻;然而九組 Muon 超參數設定之後全數跌破門檻,部分執行甚至反覆降至 1% 以下再恢復。AdamW 並非完全穩定,但崩落較依賴較大的學習率。
作者把原因定位在表徵—讀出介面。最終殘差表示 `h` 與輸出矩陣 `W_U` 只透過乘積 `W_U h` 決定 logits,因此兩者可共同換基而保持函數不變;分開使用兩種更新動力學,可能讓原本協調的基底逐漸錯位。模型解完訓練集後,梯度已降至約 `10^-6`,但 Muon 參數群每個參數的移動速度仍是 AdamW 群的 8 倍。從完全相同的狀態分叉並凍結隱藏矩陣,或凍結嵌入與輸出頭,都能避免失效;固定後者的五次執行累計觀察 451,400 個 grokking 後步驟,未再跌破門檻。
Fourier 介入還區分出真正的運算電路損壞與「遮蔽」:部分 checkpoint 中,任務對齊的頻率分量單獨仍有 100% 準確率,卻被其餘表示壓過,使完整模型只剩 45.85%;單純放大該分量可恢復至 99.9%。這表示只追蹤頻率支援或表徵功率,可能漏掉讀出競爭。
工程上值得注意的是,研究僅涵蓋小型模運算 Transformer,不能直接推論大型語言模型會同樣崩落。公開儲存庫提供訓練、介入分析、191 份 CSV 與 20 份 HTML 摘要,但未提交 checkpoint,完整重現仍需重新訓練。下一步應在較真實的預訓練與微調尺度檢查跨參數群的相對更新量,並評估凍結或共同基底約束是否比固定的 optimizer routing 更穩健。