模型訓練與最佳化
CMuon 拆分 DiT 融合權重再做正交化,675M 模型訓練速度達 AdamW 兩倍
CMuon 發現,Muon 對融合後的 QKV、AdaLN 與 FFN 權重整體正交化,會讓功能不同的子空間互相干擾。研究以分塊動量正交化改善後期收斂,但兩倍加速目前只在單一 675M DiT 設定中得到驗證。

擴散 Transformer(DiT)開始採用 Muon 取代 AdamW,以矩陣動量的 Newton–Schulz 正交化提高訓練效率;新研究 CMuon 指出,直接套用 Muon 仍有一個來自模型實作的隱藏問題。為提高運算效率,DiT 通常把 Q、K、V 投影,以及 AdaLN 的縮放、位移與門控參數,合併成較大的權重張量。標準 Muon 對整個張量共用一次正交化,相當於以所有子矩陣的梯度統計建立同一個預條件器,因而把原本功能獨立的參數更新耦合在一起。
CMuon 在正交化前,先依參數原本的功能邊界切回多個區塊,再分別處理各區塊的動量矩陣。這項修改不改變 DiT 前向架構,也不需要額外的表示對齊損失;論文稱其計算開銷可忽略。研究團隊以 ImageNet 256×256、批次大小 1,024 訓練 675M 參數模型,200 個 epoch 後取得 1.18 FID,優於同實驗中的原始 Muon,並宣稱相較 AdamW 約有兩倍收斂加速。關鍵差異是優勢延續到訓練後期,而非只在早期快速下降後停滯。
工程上,這提醒使用矩陣式最佳化器時,框架中的權重融合不只是記憶體配置細節,也會改變最佳化幾何。實作端需要保存 QKV、AdaLN 等張量的語義分界,並確認切分方向與模型版本一致。現階段證據仍限於特定 DiT、資料集與訓練配方,且研究尚未公開完整程式碼;FID 也不能單獨代表文字對齊或高解析度生成品質。下一步應觀察它能否在數十億參數的文字到影像、影片模型上重現,以及分塊後的通訊與 kernel 開銷是否仍可忽略。