模型訓練研究
補助的視点の実験:同じ知識を教材・Q&A・記事に書き換える方が、原文を繰り返すよりモデルの学習に有効
ペンシルベニア大学の研究者らは、知識に割り当てるtoken予算を固定したうえで、原文の反復の一部を複数の概念的表現に置き換え、事実の想起と推論を改善した。効果は主に7B以上のモデルで確認されたが、実験は短期間の継続事前学習にとどまり、フロンティアモデルの完全な事前学習へ直接一般化することはできない。

「データ多様性」は通常、データソースが十分に幅広いかどうかを表すだけで、同じ知識をどのように提示すべきかという問いには答えていない。新たな研究「[Knowledge Acquisition During Pre-training?](https://arxiv.org/abs/2609.04180)」は、2種類の変化を切り分けた。paraphraseは表現だけを変えるのに対し、auxiliary viewsは同じ文書を教科書の章、Stack Exchange形式のQ&A、ブログ記事へと再構成し、説明、類推、異なる文脈を補う。
研究チームは、基盤モデルの既存コーパスに含まれていない36件の文書を選定した。対象はコンピューターサイエンス論文、米国連邦控訴裁判所の判決、医療症例で、OLMo-2の1B、7B、13B、32Bモデルに対して100ステップの知識注入を実施した。各条件でモデルが見る知識関連tokenの総量は同一であるため、補助的な視点の追加は原文の直接的な反復を減らすことを意味し、単に計算量を増やしたわけではない。評価には6,435問の事実穴埋め問題、430問の推論穴埋め問題、およびそれぞれの多肢選択式版が含まれる。データと安定したIDは[Hugging Face](https://huggingface.co/datasets/jiosephlee/auxiliary-views-knowledge-acquisition)で公開されている。
結果は、原文の反復、9種類のparaphrase、さらにauxiliary viewsを加えた条件の順に性能が向上することを示した。元の事前学習により近いOLMo-2 7Bの実験では、auxiliary views条件の事実に関する多肢選択問題の正解率は0.403で、原文条件の0.372を上回った。推論問題でも0.492となり、原文条件の0.421を上回った。同じ順位関係はQwen-2.5-7Bでも確認された。研究者らはさらに、11組の生成器を使って補助テキストを作成したが、生成器の規模や生成器自体の問題正解率と下流タスクの結果との間に正の相関は見られなかった。一方、生成テキストの量とは中程度の相関が見られた。これは、強力な教師モデルの回答を生徒モデルへ蒸留するというより、データ拡張に近い。
制約も同様に重要だ。1Bモデルはほとんど恩恵を受けず、単純なparaphraseの優位性はbatch sizeを大きくすると消失した。また、いわゆる「事前学習に忠実な」対照実験も、925,000ステップ目から学習を再開して100ステップ追加しただけであり、ゼロから学習したものではない。人間が補助的な視点を執筆したテストも、わずか2件の文書しか対象としていない。エンジニアリングチームはまず、ドメイン継続事前学習において「文書の反復」と「概念的な言い換え」を比較できる。ただし次の段階では、ロングテールの専門知識、英語以外のデータ、データ汚染の制御、さらに数百億パラメータ以上のモデルと完全な学習サイクルでも効果が維持されるかを検証する必要がある。