模型訓練與最佳化
Hyper-ES、勾配で低次元探索空間を構築し、数学的推論でGRPO-LoRAを平均1%上回る
Hyper-ESは、数十億次元のモデル重み上で直接ランダムな進化的探索を行うのではなく、少数のファインチューニング方向から部分空間を構成し、層ごとのモデルマージ係数を探索する。著者らは3つのモデルと6つの数学データセットで小幅な性能向上を報告しているが、この手法は完全な勾配フリーではない。

新たに提案されたHyper-ESは、Evolution Strategyを大規模言語モデルへ直接スケールさせることの難しさに対処しようとする手法だ。従来のEvolution Strategyでは、ランダムな摂動によって更新方向を推定する。しかし、パラメータ空間が数十億次元に達すると、ほとんどの摂動は真に有用な降下方向とほぼ直交し、サンプル効率と安定性が急速に悪化する。そこでHyper-ESは、重み空間全体を闇雲に探索するのではなく、まず少数回の比較的低コストな勾配ベースのファインチューニングを実行し、それぞれの改善幅は限定的でも、タスク情報を含む複数の降下方向を取得する。
これらの方向が線形に張る空間を、その後の進化的探索の対象範囲とする。システムはCMA-ESで層ごとの係数を最適化し、DARE-TIES系のモデルマージを通じて複数の更新方向を組み合わせ、最終モデルを生成する。言い換えれば、Evolution Strategyが探索するのは「既知の有用な方向をどう混合するか」であり、数十億個のパラメータをどちらへ動かすべきかを一から見つけ直すことではない。これにより、ブラックボックス最適化の次元数は候補方向の数と層数によって決まり、理論上は全パラメータへの摂動よりも、リソースが限られたポストトレーニングに適している。
著者らは、Qwen2.5-InstructおよびDeepSeek-R1-Distill系列の計3つのバックボーンを用い、6種類の数学的推論データセットで比較を実施した。その結果、Hyper-ESはGRPO-LoRAを平均約1%上回り、中間状態の保存を必要とする勾配更新も10%削減したと報告している。この手法の技術的価値は、1ポイントの差そのものよりも、モデルマージ、低次元部分空間、Evolution Strategyを、実装可能なポストトレーニングのワークフローとして統合した点にある。また、報酬が微分不可能な場合、評価器が複雑な場合、あるいはバックプロパゲーションの回数を減らしたい場合にも応用できる可能性がある。
ただし、Hyper-ESは基底を生成するために依然として勾配ベースのファインチューニングを必要とするため、純粋なブラックボックス手法やバックプロパゲーションを一切行わない手法とは見なせない。現時点の結果も数学的推論と3つのモデルに限られており、コードエージェント、オープンエンド生成、より大規模なモデルでも同様の効果が得られることはまだ示されていない。今後は、総GPU時間、ピークメモリ使用量、探索時の評価コストを比較するとともに、方向数を増やした後も低次元性の利点が本当に維持されるかを検証する必要がある。