模型訓練與最佳化
sMuon 將 Muon 投影至 LoRA 可表達子空間,ReLoRA 同等損失下較 Riemannion 快約 30%
sMuon 先把完整權重的正交化方向投影至 LoRA 因子可表達的低秩空間,再以純矩陣乘法計算更新。方法在 ReLoRA 實驗追平 Riemannion 的最低驗證損失,但跨模型微調結果顯著依賴基礎模型原先使用的最佳化器。

Muon 會把每層權重矩陣的更新正交化,使非零奇異值趨於一致;但 LoRA 只允許以低秩矩陣 `BA` 改動權重,完整 Muon 方向通常超出這個可表達空間。新提出的 sMuon 先將 Muon 的頻譜範數最陡下降目標線性化,再解最小平方問題,把正交化梯度投影回 LoRA 的行、列子空間。作者進一步利用低秩結構改寫運算,避免對完整權重矩陣執行 QR 或 SVD,主要步驟只需矩陣乘法、逆平方根與小型矩陣運算。
在以 1.62 億參數 Transformer、FineWeb 資料及每 500 步合併一次 adapter 的 ReLoRA 實驗中,sMuon 與 Riemannion 的最終驗證損失均為 3.66,優於 LoRA-Muon 的 3.68、逐因子 Muon 的 3.70及 AdamW 的 3.83;論文同時報告 sMuon 約快 30%。它也只為每個參數保留一組動量狀態,理論上少於 AdamW 的一、二階矩估計。
結果並非全面勝出。作者在 Qwen2.5-3B、Llama-3.2-3B、DeepSeek-V2-Lite及以 Muon 預訓練的 Moonlight-16B-A3B上測試十一項常識與程式任務;sMuon 在 Moonlight 上有六項居首,但在 AdamW 預訓練模型上經常由 AdamW或其他低秩 Muon 變體領先。例如 Qwen2.5-3B 的 HumanEval pass@1,AdamW為54.9%,sMuon為51.8%。這顯示預訓練與微調最佳化器的隱式偏差仍會交互作用。工程團隊下一步應關注官方實作、分散式與混合精度穩定性,以及更高 LoRA rank 時的實際顯存和牆鐘成本;目前論文未附 sMuon 專屬公開程式庫。