ホームへ戻る

AI 研究

自己対戦事前学習が6種類の規模の重みを公開、プログラム出力から転移可能な構造を学習

生成器と学習器をランダムな重みから共同で進化させ、計算量の増加に伴ってモダリティをまたぐ予測性能が向上することを確認した。公開資料を使って再評価できる一方、訓練コードは未公開で、ハイパーパラメータ選択には自然データも使われている。

King of Hearts · CC BY-SA 3.0 · Image source
zh-Hant

9月24日に提出された「Self-Play Pretraining with Zero Data」は、ランダムな重みから始める事前学習手法を提案している。2つのモデルが共同で進化し、自ら訓練データを生成する。著者らは、自己対戦に使う計算量を増やすと、テキスト、画像、音声などの自然データに対する次バイト予測損失が、適合可能なスケーリング則を示すと報告している。[論文](https://arxiv.org/abs/2609.30063)

この手法では、生成器がBrainf*ck風のプログラムを提案し、それを実行してバイト列を生成した後、学習器をクロスエントロピーで訓練する。生成器は強化学習によって問題の作り方を改善する。報酬は、学習器の勾配と直近のパラメータ変化との整合性スコアに基づき、AdamWによるスケーリングも取り入れている。これにより、学習する価値のある構造を見つけ、純粋なランダムノイズが難易度の高い教材として扱われる問題を抑える。[手法の詳細](https://arxiv.org/html/2609.30063v1)

著者らは、約9万8,000から2,439万パラメータまで、6種類の規模の学習器の重みを公開した。モデルはLlama風のデコーダー、256バイトの語彙、4,096トークンのコンテキストを採用し、256ラウンドごとにチェックポイントを保存する。これにより、同じアーキテクチャが訓練の進行に伴ってどう変化するかを比較できるほか、固定プログラム事前分布や異なる報酬設計を使った対照条件も調べられる。公開されたのは少なくとも8,192ラウンドを完了したシードに限られるため、結果の解釈ではこの選別条件にも注意が必要だ。[モデルカード](https://huggingface.co/nourya-cohen/solomonoff-paper)

「ゼロデータ」の範囲は正確に理解する必要がある。自然データは勾配更新には使われていないが、著者らはDCLMとDNAの検証損失を使ってハイパーパラメータを選択した。主な結果はバイト予測を評価するもので、スケーリング曲線は異なるモデル、チェックポイント、アンサンブル構成を組み合わせている。現時点の証拠は小規模モデルに限られ、世界知識も実データから得る必要がある。[実験設定と制約](https://arxiv.org/html/2609.30063v1)

公開資料を使った検証には2つの方法がある。付属データから図表を再作成する方法は、GPUを必要としない。もう1つは評価スクリプトで公開コーパスをダウンロードし、固定長の系列に整形してから、重みを読み込んで再スコアリングする方法だ。スコアリングツールは結果がすでに存在する項目をスキップするため、中断後に再開できる。したがって、曲線の再作成とモデル評価の再実行では、必要なリソースと検証の強さを分けて考える必要がある。[再現ガイド](https://github.com/nourya-aliz/self_play_pretraining/blob/main/REPRODUCING.md)

完全な再訓練には、まだ不足しているものがある。生成器の重み、オプティマイザーの状態、自己対戦の訓練コードは公開されておらず、PCFGの対照条件についてもスコアリング済みデータのみが提供されている。工学的には、評価結果と訓練プロセス全体をそれぞれ検証したうえで、モデルを大規模化したとき、その効果が生成データのコストに見合うかを試すことが次の課題となる。[公開範囲](https://huggingface.co/nourya-cohen/solomonoff-paper)、[対照条件の制約](https://github.com/nourya-aliz/self_play_pretraining/blob/main/REPRODUCING.md)

出典

  1. Self-Play Pretraining with Zero Data
  2. Self-Play Pretraining with Zero Data — Full Paper
  3. Self-Play Pretraining with Zero Data: Checkpoints