模型微調/可控適應
階層別 LoRA 実験で判明:語彙・事実・行動ポリシーの学習では、最適な更新位置が異なる
新たな研究では、LoRA を Transformer の前半・中盤・後半の各層に限定し、学習目標ごとに再現可能な「適応ジオメトリ」が現れることを確認した。この結果により、adapter の配置位置は単なる実装上の詳細ではなく、知識の転移と副作用を制御する設計変数として位置づけられる。

イェール大学の研究者らは7月28日、LoRA を Transformer のどの層に挿入すべきかを検証した対照実験を公開した。一般的なファインチューニングでは、大半またはすべての層に adapter を配置するが、この研究では前半・中盤・後半のいずれかのみを個別に更新し、全層を更新する設定やパラメータ数を揃えた設定と比較した。モデルが新しい内容を習得できるか、能力を未見のサンプルに転移できるか、そして変更を対象範囲内に限定できるかを測定した。
テストは、語彙バインディング、事実関係、行動ポリシー、因果マッピング、手続き的推論という5種類の目標を対象とした。その結果、すべてに共通する最適な位置は存在しないことが示された。語彙バインディングは前半の層で習得しやすく、副作用も抑えやすかったが、広範な転移にはより包括的な更新が必要だった。事実関係では、局所的な adapter の場合、後半の層が優位だった。行動学習では、「動作を習得すること」と「条件に応じてポリシーを発動すること」が分離され、前者は後半の層、後者は中盤の層が適していた。因果タスクと手続き的タスクの転移性能は、主に中盤または全層の更新で得られた。
著者らは、各目標について acquisition、transfer、boundedness という3つの次元で描かれる曲線を adaptation geometry と呼んでいる。同じ傾向の差異は5つのモデルファミリーの大半で再現され、パラメータ数を揃えた後も残った。これは、結果が単に特定の LoRA 設定でより多くの重みを使用したためではないことを示唆する。この点は企業におけるファインチューニングで特に重要だ。単一の検証セットだけを使って rank、learning rate、target modules を選択すると、表面的には高精度でも、過度に汎化したり、異なる言い回しへ転移できなかったりする adapter が得られる可能性がある。
コードとデータは公開されており、エンジニアは階層別 adapter を追加のハイパーパラメータ探索軸として扱い、acquisition、transfer、boundedness のテストを同時に構築できる。ただし、この論文で用いられた目標は制御された比較的狭い範囲のものであり、大規模な instruction tuning、言語間適応、長期的なエージェント訓練でも同じ階層別の規則が成り立つとは直接推論できない。次の段階では、より大規模なモデル、MoE、量子化 LoRA、複数の adapter を重ねた場合にも結果が維持されるかを検証する必要がある。