模型評測
NVIDIA 程式競賽模型以 760 張 GPU 擴張測試時計算,非官方成績超越 IOI 人類最高分
Nemotron-3-Ultra-CC 在 IOI 2026 題目取得 535.4/600 分,高於官方最高選手的 498.27 分。關鍵不只是 550B 模型,而是以 GenCorrect 反覆產生、測試及修正大量候選程式;該次執行最多使用 760 張 GB300。

NVIDIA 研究團隊公布競賽程式設計專用的 Nemotron-3-CC 訓練與推論流程。研究者先整理來自 16 類競賽的 2.2 萬道題目,建立可編譯、執行並依測試案例計分的環境,再由 DeepSeek-V4-Flash 產生推理軌跡:30B、每次啟用 3B 參數的 Nano-CC 使用 120 萬筆資料接受監督微調與 GRPO;550B、每次啟用 55B 的 Ultra-CC 則使用 477,642 筆軌跡做監督微調,沒有進行程式專用 RL。
單次生成並非主要突破。團隊提出的 GenCorrect 會平行產生候選解答,在本機編譯與測試後,將錯誤、分數及先前提交結果回饋給下一輪,最後在每題最多 50 次正式提交的限制內選出程式。Nano-CC 在 IOI 2025 的單次分數由基礎模型的 130 分升至微調後 280 分、RL 後 291 分,五輪 GenCorrect 則達 468 分,顯示測試時搜尋帶來的增益大於該實驗中的 RL。
IOI 2026 的前瞻執行在題目公開前進行,遵守相同的兩個五小時時段、禁止連網及提交頻率限制,得到 535.4 分;[官方統計](https://stats.ioinformatics.org/olympiads/2026)記錄人類最高分為 498.27,金牌線為 361.12。不過,[論文](https://arxiv.org/abs/2609.02849)明確說明模型不是正式參賽者,執行也未受 IOI 監督,因此只能視為作者自報的非官方基準。
工程上更值得注意的是資源差距:現場流程最多配置 760 張 GB300,以大量候選換取固定時間內的高分,這不是模型與單一人類的等資源比較。競賽版 checkpoint、NeMo Skills 推論配方仍待釋出,完整訓練資料又受第三方授權限制;下一步應觀察外部團隊能否重現分數、縮減搜尋預算,以及 GenCorrect 是否能轉移至軟體修復等較少可靠測試預言機的工作。