AI 晶片設計
Nemotron 3 Ultra 接入 ACE-RTL 迭代代理,九類晶片設計任務平均通過率達 97.1%
NVIDIA 將 Nemotron 3 Ultra 放進固定的生成、模擬、反思迴圈,在 CVDP 九類 RTL 任務取得 97.1% 平均通過率。結果同時顯示代理框架可大幅抬高各模型成績,但比較仍限於三款開放模型與單一評測流程。

NVIDIA 於 7 月 26 日公布 Nemotron 3 Ultra 在代理式 RTL 程式設計上的新評測。實驗沒有只要求模型從提示一次生成 Verilog,而是把模型接入 ACE-RTL:generator 負責產生或修改 RTL,reflector 解讀模擬器與檢查工具的失敗訊息,coordinator 則整理跨輪除錯上下文,決定下一次生成應保留哪些規格、程式與錯誤證據。這更接近硬體工程師反覆執行編譯、模擬、lint 與修正的流程。
在 CVDP 的九類任務中,固定相同 ACE-RTL 框架、只替換底層模型後,Nemotron 3 Ultra 的平均通過率為 97.1%,高於 Kimi K2.6 的 95.2% 與 GLM 5.2 的 92.1%。單看 `cid016` 除錯修復任務,三款模型接入代理後分別由 65.7%、68.6% 與 44.0%,提高至 100%、97.1% 與 94.3%。這組差距提醒評測者:RTL 能力不只由模型權重決定,測試回饋、歷史壓縮與反思提示同樣可能主導最終成功率。
Nemotron 3 Ultra 每輪平均使用 6,629 token,低於 GLM 5.2 的 9,156 與 Kimi K2.6 的 22,579。模型本身是 550B 總參數、每 token 啟用 55B 的混合 Mamba-Attention MoE,具一百萬 token 上下文;訓練資料也刻意加入規格生成、既有 RTL 編輯,以及注入狀態機、握手與時序錯誤後的修復樣本。資料管線會執行語法檢查、基準污染檢查及 LLM rubric 評分。
不過,這仍是供應商主導的內部比較,沒有納入商用前沿模型,也未把 token 數直接換算成相同硬體上的延遲、能耗或成本。下一步應觀察 ACE-RTL 與 CVDP 結果能否由外部團隊重現,以及代理產生的設計能否通過形式驗證、時序收斂與實際 RTL-to-GDS 流程,而非只在模擬測試中通過。