模型訓練與長上下文
長上下文訓練出現倒 U 曲線:窗口超過任務長度約 16 至 32 倍後能力轉弱
新研究指出,較長訓練窗口可能令模型依賴上下文,而非把知識寫入參數。750M 以下預訓練及 Qwen3 微調實驗均顯示,支持性資料增加的同時,無上下文與衝突情境的穩健性下降。

長上下文通常被視為單向擴充能力,但約翰霍普金斯大學團隊提出「資訊豐富悖論」:訓練序列若反覆提供足以直接解題的證據,模型可藉注意力讀取當下資料,因而減少把規律內化至權重的壓力。這不只是推論時的 lost-in-the-middle 問題,而是訓練窗口改變了模型選擇何種解法。
團隊先以最高 750M 參數的模型改變預訓練窗口,再測試語言建模、SuperGLUE 與 11 套閉卷選擇題。三類指標都呈倒 U 曲線:窗口起初增長有利,超過中間最佳點後反而下降。Penn Treebank、LAMBADA、WikiSPAN 的最佳窗口分別為 512、2,048、8,192 token;MCQA 與 SuperGLUE 均在 2,048 token 開始轉弱。五組資料的轉折點約為平均樣本長度的 16 至 32 倍,但這只是離散設定下的經驗規律,不能直接當成通用配置公式。
另一組實驗以 LoRA 微調 Qwen3 0.6B 至 14B,固定每題八份文件,只改變其中零、四或八份是否來自目標領域。目標文件愈多,模型在支持性上下文下愈準,卻在沒有上下文或文件刻意支持錯誤答案時更脆弱。模組梯度分析顯示,資訊豐富的訓練把相對更新壓力由前饋網路移向自注意力;限制只更新其中一類模組及 token 注意力介入,也支持「由參數記憶轉向情境讀取」的解釋。
對工程團隊而言,長窗口資料配方不應只以長上下文 perplexity 或 needle 測試驗收,還要加入閉卷、缺漏檢索及衝突證據測試。研究的主要限制是預訓練規模僅到 750M;Phi‑3、OLMo 3 的短長版本比較只是動機觀察,未能控制所有訓練差異。作者已在 Hugging Face 公開合成任務、tokenizer 與小模型產物,下一步應在更大模型、相同 token 預算及真正長文件上重現轉折位置。