返回首頁

模型訓練與評估

LittleLearner 將預訓練知識限於小五程度,進階數學少樣本提示仍停在約 6%

研究團隊從 FineWeb‑Edu 篩出 880 億 token 的 K–5 語料,並從零訓練 0.6B、1.3B 與 5B 模型及同算力對照組。實驗顯示擴大模型、SFT+GRPO 和上下文示例主要喚起已有能力,未明顯突破預訓練知識邊界。

Ian S · CC BY-SA 2.0 · Image source
zh-Hant

語言模型是否真的「學會」新能力,長期受預訓練資料不透明干擾:後訓練分數上升,可能只是把原本潛藏的知識喚出。LittleLearner 反過來控制來源,從 FineWeb‑Edu 建立 880 億 token 的 LittleCurriculum,只保留美國幼稚園至小五程度內容。管線結合詞彙習得年齡、LLM 分級器、課程規則及符號過濾;對 126 組小五以上概念 n‑gram 的掃描顯示,僅 0.09% 保留段落出現匹配。

團隊依 Qwen3 架構從零訓練 0.6B、1.3B、5B 三種模型,並為每個規模建立架構、token 數與訓練配方相同、但使用未過濾語料的控制組;5B 訓練約使用八張 B200 共 100 小時。MathCAMPS 測試顯示,增加參數能改善 K–5 及鄰近的六、七年級問題,八年級題目卻維持接近地板。對 5B 聊天模型加入自然語句示例後,K–5 準確率由 34.0%升至 36.8%,小五以上則由 6.0%微降至 5.9%;精簡代數或只給問答的示例更差。

SFT 後接 GRPO 的結果亦相近:即使把範圍外數學題交給受限模型後訓練,仍未縮小它與未過濾控制組的差距。這使 LittleLearner 成為研究 RL 能否真正創造能力、持續學習干擾及模型知識校準的較乾淨沙盒。模型與對照權重已列於[專案頁](https://littlelearner-ll.github.io/),但結論目前只涵蓋最高 5B、特定數學任務與有限後訓練預算;「課程以外」也不等於語料完全沒有洩漏,不能直接外推至前沿模型。

來源

  1. LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure
  2. LittleLearner project page and released checkpoints