返回首頁

模型後訓練/開發平台

Prime Intellect 將 Nemotron 3 Nano 的 RLVR、LoRA 與部署收斂為託管訓練流程

NVIDIA 公開一套可重現的託管後訓練流程,讓開發者以 Prime CLI 對 30B MoE 模型執行 100 步 RLVR,再下載或部署 LoRA。示範在 32 道數學題上由 21.9% 升至 90.6%,但樣本小且任務與獎勵高度受控。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

NVIDIA 與 Prime Intellect 在 7 月 23 日公開 Nemotron 3 Nano 的端到端客製化範例,將基線評測、具可驗證獎勵的強化學習、LoRA 產物與推論部署放進同一套託管工作流。開發者以 Prime CLI 建立工作區、固定環境版本,再選擇託管模型,不必自行配置多 GPU 訓練叢集。

範例使用 NVIDIA-Nemotron-3-Nano-30B-A3B-BF16。其總參數量為 300 億、每 token 啟用約 35 億參數,結合 23 層 Mamba-2、23 層 MoE 與六層注意力;每個 MoE 層含 128 個路由專家、一個共享專家,並啟用六個專家。訓練環境要求模型使用 Python、NumPy、SymPy 或 SciPy 解題,輸出以規則式評分器給予二元獎勵,因而不需另用大型模型擔任裁判。

官方設定執行 100 個步驟,每題採樣八次、批次共 32 個 rollout,學習率為 2e-5,並把每次解題限制在五個 assistant turn。完成後平台產生可下載的 LoRA adapter,也可將其掛到原模型的託管推論端點。NVIDIA 報告相同 32 道保留題的平均獎勵由 0.219 升至 0.906,即答對題數從 7 題增加到 29 題,訓練花費低於五美元。

這項發布的技術意義不在新模型,而是把 RLVR 的實驗閉環商品化:環境、模型版本、rollout、獎勵曲線與 adapter 都能追蹤。不過,32 題不足以證明一般數學能力提升,且格式獎勵可能主要教會模型停止亂用工具與輸出 `boxed` 答案。團隊在採用前應加入更大且未見過的測試集、檢查原能力退化,並比較 LoRA、監督微調和純提示修正的成本效益。

來源

  1. Start Customizing NVIDIA Nemotron 3 Nano with Prime Intellect Lab in Minutes
  2. NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 model card