返回首頁

研究與評測

NVIDIA 補齊 IMO 金牌推理配方:每題先生成 384 份證明,再以多輪評審篩選

NVIDIA 更新 Nemotron IMO 2026 資源,公開 SFT/RL 權重、資料、提示詞及可續跑的完整推論程式。系統取得 30/42 分,但成果高度依賴三個 561B checkpoint 與龐大的測試時計算,不能視為單次模型回答能力。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

NVIDIA 在過去兩天更新 Nemotron Labs IMO 2026 資源集,把先前論文中的數學專用 SFT、RL checkpoint、兩套訓練資料及 200 題 Nemotron‑IMO‑Bench 補齊,並公開實際提交證明與端到端推論配方。這套系統以自然語言完成 2026 國際數學奧林匹亞六題,得到 30/42 分、達金牌門檻;全程沒有形式證明器、搜尋引擎或外部數學工具。重要之處不只在分數,而是外界現在能檢查「金牌級」結果究竟用了多少候選生成、模型互評與選擇計算。

每題第一輪由通用、SFT 與 RL 三個 Nemotron 3 Ultra checkpoint,各自套用八種提示並為每種取樣 16 次,合計生成 384 份證明。去重後,每份證明分別交給 SFT 與 RL 模型各判斷八次,只有 16 次判斷全部通過才被接受。第二至第八輪會取證明池中最佳 16 份,帶入最多八則評審批註,再由三個模型各改寫四次,因此每輪另產生 192 個候選。最後,三個 checkpoint 又各以 IMO 的 0–7 分規則評閱決賽證明 16 次,即每份候選接受 48 次評分後才選出提交版本。

公開程式可連接任何 OpenAI 相容端點,會把每次請求寫成可恢復的 JSONL,並以提示、模型、輸入及設定雜湊阻止續跑時配置漂移;完整輸出還保留隨機種子、來源證明、批註和 token 用量。這提高了流程層級的可稽核性,卻不等於低成本重現:三個模型均約 561B 參數,completion 可配置至 512K token,而多輪候選數遠超一般 best‑of‑N 評測。研究者比較其他 IMO 成績時,應分開報告基礎模型、總推論 token、評審模型及選擇策略;下一步則是由獨立團隊重跑公開六題與全新題目,確認評審自洽是否能轉化為穩定的證明正確率。

來源

  1. An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics
  2. Nemotron Labs IMO 2026 collection
  3. Nemotron‑IMO‑TTS reproducible inference recipe