模型訓練研究
輔助視角實驗:同一知識改寫成教材、問答與文章,比重複原文更利於模型吸收
賓州大學研究者在固定知識 token 預算下,以多種概念表述取代部分原文重複,改善事實回憶與推理。效果主要出現在 7B 以上模型,但實驗仍是短程持續預訓練,不能直接外推至前沿模型的完整預訓練。

「資料多樣性」通常只描述資料來源夠不夠廣,卻沒有回答同一項知識應如何呈現。新研究 [Knowledge Acquisition During Pre-training?](https://arxiv.org/abs/2609.04180) 把兩種變化拆開:paraphrase 只改變措辭,auxiliary views 則把同一文件重新組織成教科書章節、Stack Exchange 式問答及部落格文章,補上解釋、類比與不同脈絡。
團隊選取 36 份不在基礎模型既有語料中的文件,涵蓋電腦科學論文、美國聯邦上訴法院判決及醫療病例;再對 OLMo-2 的 1B、7B、13B、32B 模型做 100 次知識注入。各條件所見的知識相關 token 總量相同,因此加入輔助視角代表減少原文直接重複,而非單純增加算力。評估包含 6,435 題事實填空、430 題推理填空及其選擇題版本,資料與穩定 ID 已放上 [Hugging Face](https://huggingface.co/datasets/jiosephlee/auxiliary-views-knowledge-acquisition)。
結果顯示,原文重複、九種釋義、再加輔助視角的表現依序提高;在較貼近原始預訓練的 OLMo-2 7B 實驗中,輔助視角的事實選擇題準確率為 0.403,高於原文的 0.372,推理題為 0.492,高於原文的 0.421。相同排序也出現在 Qwen-2.5-7B。研究者另用十一組生成器製作輔助文本,沒有發現生成器尺寸或自身答題準確率與下游結果呈正相關,反而是生成文本量呈中度相關;這較像資料增強,而非把強教師的答案蒸餾給學生。
限制同樣重要:1B 模型幾乎沒有受益,單純釋義的優勢會隨 batch 增大而消失;所謂「預訓練忠實」對照也只是從第 925,000 步恢復後再跑 100 步,並非從零訓練。人類撰寫輔助視角的測試更只涵蓋兩份文件。工程團隊可先在領域持續預訓練中比較「重複文件」與「概念性重述」,但下一步仍須驗證長尾專業知識、非英語資料、污染控制,以及在數百億參數以上與完整訓練週期中是否保留增益。