ホームへ戻る

模型訓練與合成資料

Reasoning Core 以 50 種程序生成器擴充監督資料,3B 模型 DROP F1 由 33.1 升至 41.7

Reasoning Core 用可執行評分器、難度控制與短答案格式產生數學、規劃、形式證明及程式題。匹配訓練實驗顯示它優於三套程序資料集,但作者也在外部資料庫發現生成器與評分器不一致。

zh-Hant

Reasoning Core 把程序生成資料從強化學習環境搬到 completion-supervised fine-tuning。公開套件包含 50 個生成器,涵蓋數學、Lean 與 Metamath 證明、邏輯推論、規劃、狀態追蹤、圖論、正規語言、表格及程式執行;每個任務都能由種子與難度產生題目、結構化答案及語意評分函式。儲存庫另提供固定依賴、Docker 執行環境、版本化 manifest、快取與行為雜湊,Hugging Face 集合已有逾 100 億 token 的預生成資料。

其設計重點不是要求模型重現完整推理軌跡,而是提供短而確定的監督目標。集合或等價表示先轉成 canonical answer;評測時則可用集合無序比較、變數重新命名、計畫實際執行、Lean 編譯或程式測試接受其他正確答案。作者發現,圖搜尋與剖析任務即使附上正確的逐步演算法紀錄,對 BBH 開發集與 FineWeb NLL 的轉移效果仍 consistently 低於短答案,縮短紀錄也未扭轉結果。

團隊把四套程序資料各配置為總 prompt-plus-answer token 的 20%,以相同資料順序、最佳化設定及最多 2,400 次更新,比較 SmolLM2、OLMo 與 SmolLM3。主要 3B、五種 seed 結果中,Reasoning Core 將 DROP F1 從 33.1 提高至 41.7、LogiQA 從 46.8% 升至 47.8%、ARC-Challenge 從 50.7% 升至 51.3%,BBH-test 也由 43.6 升至 45.3;其餘三套資料未在這些指標上全面勝過基線。

這項工作同時提醒工程師,可驗證資料並非「生成即正確」。模型輔助檢查、人工裁決與回歸測試在 Reasoning Gym 的 105 個任務中確認 13 個預設路徑缺陷,另在九個 SynLogic 生成器發現實質問題,包括任何非空答案都得滿分,以及顯示限制與內部解答互相矛盾。這項稽核由競爭資料集作者執行、並非盲測;成果也集中於最高 3B 的模型,尚不能證明相同資料設計能直接擴展到前沿模型或大規模預訓練。

出典

  1. Reasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning Training
  2. Reasoning Core source repository
  3. Reasoning Core dataset collection