模型訓練與資料
合成教材的章節組織本身可改善中期訓練,固定文字後平均分仍提高 1.02 點
一項新研究生成 68.6 萬本、共 320 億 token 的合成教材,並以內容相同的對照實驗隔離文件結構效應。把相關章節組成完整書籍優於拆散段落或隨機串接,但收益仍來自研究團隊自建訓練流程,資料與程式尚未公開。

合成訓練資料的討論通常集中在文字品質、改寫提示與教師模型,新研究則把「文件如何組織」視為獨立訓練變數。團隊先從預訓練語料檢索來源,依主題聚類,再規劃階層式目錄並組裝有來源依據的章節,最終產生 68.6 萬本合成教材、約 320 億 token,涵蓋逾 1.5 萬個學科。
關鍵結果不是單純比較合成與自然文本。研究建立 Split 對照:保留完全相同的生成文字與 token,只把各章拆成獨立文件。完整書籍版本的平均下游分數仍高 1.02 點,表示收益不能只歸因於內容。RandomConcat 則把不同教材的章節串成相近長度,表現仍低於完整版本,排除了「文件較長」這項簡單解釋。與使用相同檢索池、但只逐篇改寫的 Rephrase 流程相比,完整聚類、目錄規劃與組書流程平均領先 1.17 點;替換中期訓練配方中的自然書籍時,平均改善為 1.09 點。
這項結果暗示,跨章節的概念順序、重複與依賴關係可能影響模型學習長距知識結構。對資料工程而言,document boundary 不再只是打包與 I/O 細節,也可能是能與資料配比、序列長度共同調整的品質維度。
但分數是多項評測的平均差值,未必能反映每個能力或語言的穩定收益;生成流程也可能把教師模型的偏誤與錯誤擴展至整本教材。目前缺少公開語料、生成程式與外部重現,工程團隊應等待逐項評測、污染檢查及不同模型規模的 scaling 結果,再判斷額外的聚類與生成成本是否值得。