模型最佳化
新研究指出 Adam 會打破矩陣分解對稱性,相同函數可收斂至不同注意力表示
研究將 Adam 與低秩恢復差異追溯至逐座標預條件器不具 gauge equivariance。公開實驗中,兩個功能等價初始化經 Adam 訓練後,其注意力不變量相差 56%,但結論尚未經大型模型預訓練驗證。

一篇新預印本指出,Adam 的逐座標縮放不只改變收斂速度,也可能讓參數採用哪個座標基底直接影響最後學到的函數表示。對分解矩陣 `W = UVᵀ` 而言,將兩個因子同時旋轉為 `(UQ, VQ)` 不會改變 `W`,因此損失函數看不到這項 gauge symmetry;但 Adam 的二階動量依每個座標分別累積,旋轉後的更新方向不再等價。
作者把最佳化器分成兩群。梯度下降、momentum、共享單一尺度的 Adam、Muon 與 Shampoo 保留 gauge equivariance;Adam、RMSProp、Lion、signum、Adafactor 等逐座標方法則不保留。論文進一步證明,無記憶且符合該對稱性的更新規則必須是由 Gram matrix 決定的左預條件器,並用一個從逐座標尺度連續過渡至共享尺度的參數,實驗性地把低秩偏好逐步恢復,將差異定位到預條件器的各向異性。
在欠定矩陣感測中,各方法都把訓練誤差降至插值區域,分野卻出現在選中的解:保持對稱性的更新較接近植入的低秩真值。兩套高光譜資料於相同訓練損失、最低取樣密度下,梯度下降的保留資料誤差比 Adam 低 43% 至 44%。Transformer 測試則從兩組經旋轉但功能相同的注意力初始化出發;Adam 第一個步驟便讓路徑分離,最終每個 head 的不變量 `W_QᵀW_K` 相對 Frobenius 距離相差 56%,而對稱更新器的差異維持在浮點誤差附近。
公開儲存庫提供九種更新規則、原始 JSONL 紀錄、25 組定理身分測試,以及 FlowAdam 原型。其 `precond_power` 可在一般 Adam 與共享 RMS 尺度間調節,但完全保持對稱還要求 global-norm clipping,現有實作只接受一個參數群組並需要 closure。對工程實務而言,這表示重新參數化未必對 Adam 無害;不過目前證據主要是矩陣恢復、小型注意力實驗與高光譜資料,尚不足以斷言大型語言模型改用對稱最佳化器就會提高整體品質。