返回首頁

開放模型

IBM Granite 4.2 開放三款密集式推理模型,但官方文件對訓練起點說法不一

Granite 4.2 以 3B、8B、30B 三種尺寸加入可切換的思考模式、原生工具呼叫及最長 512K 上下文,並採 Apache 2.0 授權。8B 與 30B 接受沙盒式代理強化學習,但模型卡與技術文章對模型是否從零預訓練存在矛盾。

Simon Greig · CC BY 2.0 · Image source
zh-Hant

IBM 在 8 月 25 日發布 Granite 4.2,提供 3B、8B、30B 三款 decoder-only 密集式 Transformer。三者均支援完整思考、低運算量思考及不思考模式,並可透過 vLLM、SGLang 的 OpenAI 相容端點輸出原生函式呼叫;權重採 Apache 2.0 授權。模型的原生序列長度是 128K,官方另以長上下文訓練宣稱可延伸至 512K。[IBM Research](https://research.ibm.com/blog/introducing-granite-4-2)將它定位為可在雲端、地端及邊緣分級部署的代理模型系列。

技術重點不只在加入 `<think>` 標記。IBM 公開的訓練說明稱,SFT 語料約有 720 萬筆、合計約 1,000 億 token,其中 31.6% 是代理資料;8B 與 30B 隨後在真實沙盒接受額外 agentic RL,練習終端操作、程式修改、搜尋及工具選擇,3B 則沒有這一階段。官方亦發布 FP8、FP4 和多種 GGUF 量化版本,降低自行部署門檻。[技術文章](https://huggingface.co/blog/ibm-granite/granite-4-2)列出的內部結果中,30B 在 SWE-bench Verified、Terminal-Bench 2.1 分別取得 57.0% 與 29.24%,8B 則為 47.67% 與 20.56%。

不過,訓練來源目前有值得工程團隊先釐清的矛盾:同一篇技術文章稱三款模型以約 15 兆 token「從零預訓練」,30B [模型卡](https://huggingface.co/ibm-granite/granite-4.2-30b)卻把 Granite 4.1-30B-Base 列為基礎模型,並稱 4.2 是由它後訓練而來。這會影響資料沿襲、授權與可重現性判讀。現有代理及長上下文數字也主要來自 IBM 自評;中文雖列入測試語言,尚缺獨立中文工具呼叫評測。下一步應觀察 IBM 是否修正文檔、公開完整評測設定,以及 512K 實際部署時的 KV-cache 成本與準確率衰減。

來源

  1. Granite 4.2 brings native reasoning to enterprise agents
  2. Granite 4.2 LLMs: How They're Built
  3. Granite 4.2 30B model card