ホームへ戻る

模型訓練與長上下文

長文脈学習に逆U字曲線:ウィンドウがタスク長の約16~32倍を超えると能力が低下

新たな研究によると、学習ウィンドウを長くすると、モデルは知識をパラメータに書き込む代わりに文脈へ依存する可能性がある。750M以下の事前学習モデルとQwen3のファインチューニング実験では、補助情報が増える一方、文脈なしや矛盾する状況での堅牢性が低下した。

Crawgh at English Wikipedia · CC BY 2.5 · Image source
zh-Hant

長文脈は通常、能力を一方向に拡張するものと見なされている。しかし、ジョンズ・ホプキンス大学の研究チームは「情報豊富性のパラドックス」を提唱した。学習シーケンス内で問題を直接解くのに十分な証拠が繰り返し提示されると、モデルはattentionを通じてその場の情報を読み取れるため、規則を重みに内在化する圧力が弱まるという。これは推論時のlost-in-the-middle問題にとどまらず、学習ウィンドウがモデルによる解法の選択そのものを変える現象だ。

研究チームはまず、最大750Mパラメータのモデルで事前学習ウィンドウを変更し、言語モデリング、SuperGLUE、11種類のクローズドブック多肢選択問題を評価した。3種類の指標はいずれも逆U字曲線を示した。ウィンドウの拡大は当初有効だったが、中間の最適点を超えると性能が低下した。Penn Treebank、LAMBADA、WikiSPANの最適ウィンドウは、それぞれ512、2,048、8,192 tokenだった。MCQAとSuperGLUEはいずれも2,048 tokenから性能が低下し始めた。5つのデータセットにおける転換点は平均サンプル長の約16~32倍だったが、これは離散的な設定で得られた経験則にすぎず、汎用的な設定公式として直接利用することはできない。

別の実験では、Qwen3 0.6B~14BをLoRAでファインチューニングした。各問題につき8件の文書を固定し、そのうち対象ドメイン由来の文書を0件、4件、または8件に変更した。対象文書が増えるほど、モデルは回答を裏付ける文脈がある場合に高い精度を示した一方、文脈がない場合や、文書が意図的に誤答を支持する場合には脆弱になった。モジュール別の勾配分析では、情報豊富な学習によって相対的な更新圧力がfeed-forward networkからself-attentionへ移ることが示された。特定種類のモジュールだけを更新する制約付き実験とtoken attentionへの介入も、「パラメータによる記憶から文脈の読み取りへ移行する」という解釈を支持した。

エンジニアリングチームにとって、長いウィンドウ向けのデータ配合は、長文脈perplexityやneedleテストだけで検証すべきではない。クローズドブック、検索結果の欠落、矛盾する証拠を用いたテストも追加する必要がある。この研究の主な制約は、事前学習の規模が750Mまでに限られている点だ。Phi-3とOLMo 3の短文脈版・長文脈版の比較は動機付けのための観察にすぎず、学習上のあらゆる差異を統制できていない。著者らは合成タスク、tokenizer、小規模モデルの成果物をHugging Faceで公開している。次の段階では、より大規模なモデル、同一のtoken予算、実際の長文書を用いて転換点を再現する必要がある。

出典

  1. Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge
  2. Information Abundance Paradox artifacts