模型訓練與資料
合成教材の章構成自体が継続事前学習を改善、テキストを固定しても平均スコアは1.02ポイント向上
新たな研究では、合計320億tokenに上る68万6,000冊の合成教材を生成し、内容を同一にした対照実験によって文書構造の効果を切り分けた。関連する章を完全な書籍として構成した場合、分割した段落やランダムな連結より優れたが、この成果は研究チーム独自の訓練パイプラインによるもので、データとコードはまだ公開されていない。

合成訓練データをめぐる議論は通常、テキストの品質、リライト用プロンプト、教師モデルに集中する。これに対し、新たな研究は「文書をどのように構成するか」を独立した訓練変数として扱った。チームはまず事前学習コーパスからソースを検索し、トピック別にクラスタリングしたうえで、階層型の目次を設計し、出典に基づく章を組み立てた。最終的に、1万5,000を超える分野を網羅する68万6,000冊、約320億tokenの合成教材を生成した。
重要な結果は、合成テキストと自然テキストを単純に比較したものではない。研究ではSplit対照条件を構築し、生成されたテキストとtokenを完全に同一に保ちながら、各章を独立した文書へ分割した。それでも完全な書籍版の下流タスクにおける平均スコアは1.02ポイント高く、改善を内容だけでは説明できないことが示された。RandomConcatでは、異なる教材の章を同程度の長さになるよう連結したが、性能は依然として完全版を下回り、「文書が長いから」という単純な説明も排除された。同じ検索プールを使用しつつ文書ごとにリライトするだけのRephraseパイプラインと比べると、完全なクラスタリング、目次設計、書籍化を行うパイプラインは平均で1.17ポイント上回った。継続事前学習のレシピに含まれる自然な書籍を置き換えた場合の平均改善幅は1.09ポイントだった。
この結果は、章をまたぐ概念の順序、反復、依存関係が、モデルによる長距離の知識構造の学習に影響し得ることを示唆する。データエンジニアリングの観点では、document boundaryはもはやパッキングやI/O上の細部にとどまらず、データ配合やsequence lengthと合わせて調整できる品質次元である可能性がある。
ただし、報告されたスコアは複数のベンチマークにおける平均差であり、個々の能力や言語で安定した改善が得られるとは限らない。生成パイプラインによって、教師モデルのバイアスや誤りが教材全体へ拡大される可能性もある。現時点では、公開コーパス、生成コード、外部による再現結果が不足している。エンジニアリングチームは、ベンチマーク別の結果、データ汚染の検査、異なるモデル規模におけるscalingの結果が示されるまで待ち、追加のクラスタリングと生成に伴うコストが妥当かどうかを判断すべきだ。