返回首頁

模型訓練與數學推理

Nemotron 以三模型生成—驗證—修正流程取得 IMO 金牌,但完整競賽耗用 2.31B token

NVIDIA 公開兩個 Nemotron 3 Ultra 數學專家權重、訓練資料與可恢復的自然語言證明管線,正式成績為 30/42 分。結果也暴露模型驗證器的共同盲點:內部評分高估兩題,且高精確率是以大量誤拒與運算成本換得。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

NVIDIA 研究團隊公開 IMO 2026 系統的權重、資料與推論配方。系統以 550B 總參數、每次啟用約 55B 的 Nemotron 3 Ultra 為基礎,另外訓練 SFT 與 RL 兩個數學專家;SFT 最長序列達 425,984 token,其語料從 15,879 道高難度證明題出發,由 DeepSeek V4 Pro 產生初稿、修正軌跡、驗證與後設驗證資料。

競賽管線並非單次回答。第一輪由三個 checkpoint 配合八種提示產生 384 份候選證明;RL 與 SFT 模型再各做八次無參考答案評判,16 票全數認定正確才提前接受。未通過者會從證明池挑選高分候選,連同批評送回三個模型修正,最多執行八輪。最後階段則由三模型對每位 finalist 各做 16 次 IMO 式評分,再依 48 次判斷的平均值選稿。公開的 NeMo-Skills 配方可連接 OpenAI 相容端點,逐筆保存 JSONL,因此中斷後能續跑。

這套純自然語言、未用形式證明器或網路的系統獲官方閱卷 30/42 分,跨過 29 分金牌線;找到最終投稿約耗用 707M token、1,464 GB200 GPU 小時,而競賽時限內已啟動的完整工作量達 2.31B token與約 4,800 GPU 小時。這表示成績同時來自後訓練、checkpoint 多樣性與極高測試時計算,不能視為單模型一次生成能力。

驗證仍是核心風險。內部與事後模型評審都估為約 32 分,卻共同放過第 3、6 題的缺陷;300 份證明稽核中,16 票一致規則把假接受率壓至 1.1%,但假拒絕率達 81.3%。下一步應觀察第三方能否在固定 token/GPU 預算下重現結果,以及加入形式檢查器或異質模型裁判後,能否減少相關性錯誤。

來源

  1. An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics
  2. Nemotron-IMO-TTS
  3. Nemotron-3-Labs-Ultra-Math-SFT