返回首頁

開放模型與代理訓練

Granite 4.2 以代理環境強化學習訓練 8B/30B 模型,並開放 FP4、FP8 與 GGUF 版本

IBM 發布 3B、8B、30B 三款 Apache 2.0 密集模型,加入可切換推理模式與原生工具呼叫。8B、30B 額外在程式庫、終端及搜尋沙箱中接受代理式強化學習,但官方資料對基礎訓練沿革的描述並不一致。

Simon Greig · CC BY 2.0 · Image source
zh-Hant

IBM 發布 Granite 4.2 的 3B、8B 與 30B 密集 decoder-only 模型,全部採 Apache 2.0 授權。三款模型均提供完整 thinking、non-thinking 與 low-effort thinking 模式,並可輸出 OpenAI function-calling 格式;8B、30B 再加入代理式強化學習,讓模型在真實沙箱內編輯及執行程式、操作終端與搜尋網頁。

[技術說明](https://huggingface.co/blog/ibm-granite/granite-4-2) 顯示,架構使用 GQA、RoPE、SwiGLU 與 RMSNorm,原生序列長度為 131,072 token。SFT 語料約有 720 萬筆、100B token,其中 31.6% 屬代理資料;代理部分又有 69% 聚焦軟體工程。IBM 以 GPT-OSS-120B 與 Gemma 4 作資料裁判,過濾虛構內容、無效工具互動及不存在的函式呼叫。

強化學習管線把 NeMo-RL 用於訓練、NeMo-Gym 用於環境與驗證器,並將生成和策略更新放在不同 GPU 池非同步執行。官方報告 30B 在 SWE-bench Verified、SWE-bench Pro 與 Terminal-Bench 2.1 分別取得 57.00%、33.29%及29.24%,RULER 128K 為81.38;這些均是 IBM 自行量測,尚非獨立排名。部署端除 BF16 權重外,另有動態 FP8、以 2,000 筆 SFT 樣本校準的 NVFP4/MXFP4,以及多種 GGUF 量化,可透過 vLLM 或 SGLang 提供 OpenAI 相容端點。

值得追查的是來源一致性:技術文章稱模型以約15T token「從頭預訓練」,[官方 GitHub](https://github.com/ibm-granite/granite-4.2-language-models) 卻稱4.2是在 Granite 4.1 base 上後訓練,兩者對模型血統的描述需要 IBM 澄清。工程團隊也應實測低努力模式的 token 節省、量化後工具呼叫可靠度、中文能力,以及模型在未見過的代理框架中能否維持官方沙箱成績。

來源

  1. Granite 4.2 LLMs: How They're Built
  2. Granite 4.2 brings native reasoning to enterprise agents
  3. Granite 4.2 Language Models