模型最佳化
新研究、Adamが行列分解の対称性を破り、同一の関数でも異なる注意表現に収束し得ると指摘
研究は、Adamと低ランク復元の差異を、座標ごとの前処理器が gauge equivariance(ゲージ同変性)を持たないことに帰着させた。公開実験では、機能的に等価な2つの初期化をAdamで学習した結果、注意機構の不変量に56%の差が生じたが、この結論は大規模モデルの事前学習ではまだ検証されていない。

新たなプレプリントによると、Adamの座標ごとのスケーリングは収束速度を変えるだけでなく、パラメータがどの座標基底を採用するかによって、最終的に学習される関数表現が直接左右される可能性がある。分解された行列 `W = UVᵀ` では、2つの因子を同時に `(UQ, VQ)` へ回転しても `W` は変化しないため、損失関数からはこの gauge symmetry(ゲージ対称性)を観測できない。しかし、Adamの二次モーメントは座標ごとに個別に蓄積されるため、回転後の更新方向は同値ではなくなる。
著者らはオプティマイザを2群に分類した。勾配降下法、momentum、単一の共有スケールを用いるAdam、Muon、Shampooは gauge equivariance(ゲージ同変性)を保持する一方、Adam、RMSProp、Lion、signum、Adafactorなどの座標ごとの手法は保持しない。論文はさらに、メモリレスでこの対称性を満たす更新則は、Gram matrixによって決まる左前処理器でなければならないことを証明した。また、座標ごとのスケールから共有スケールへ連続的に遷移するパラメータを用い、低ランクへの選好が段階的に回復することを実験で示し、差異の原因を前処理器の異方性に特定した。
劣決定行列センシングでは、すべての手法が学習誤差を補間領域まで低下させたものの、違いは選択される解に現れた。対称性を保持する更新は、埋め込まれた低ランクの真値により近かった。2つのハイパースペクトルデータセットでは、学習損失が同一でサンプリング密度が最低の条件において、勾配降下法のホールドアウトデータ誤差はAdamより43~44%低かった。Transformerのテストでは、回転されているものの機能的には同一な2組の注意機構の初期化から開始した。Adamでは最初のステップから軌跡が分岐し、最終的に各headの不変量 `W_QᵀW_K` の相対Frobenius距離に56%の差が生じた一方、対称性を保持するオプティマイザでの差は浮動小数点誤差程度にとどまった。
公開リポジトリでは、9種類の更新則、未加工のJSONLログ、25組の定理恒等式テスト、FlowAdamのプロトタイプが提供されている。その `precond_power` は、通常のAdamと共有RMSスケールの間を調整できる。ただし、対称性を完全に保持するにはglobal-norm clippingも必要であり、現行実装は単一のパラメータグループのみを受け付け、closureを必要とする。エンジニアリングの観点では、これは再パラメータ化がAdamにとって必ずしも無害ではないことを意味する。しかし、現時点の証拠は主に行列復元、小規模な注意機構の実験、ハイパースペクトルデータに基づいており、大規模言語モデルで対称性を保持するオプティマイザを採用すれば全体的な品質が向上すると断言するには不十分である。