返回首頁

開放模型/端側推論

MiniCPM5‑2B 公開完整訓練階段與端側格式,16 個 RL 專家蒸餾回單一模型

OpenBMB 發布 MiniCPM5‑2B、訓練資料及從預訓練到 RL 的多階段權重,並提供 GGUF、MLX、GPTQ 與推測解碼版本。模型維持標準 Llama 架構與 128K 上下文,但工具呼叫所需的 SGLang 解析器目前可能仍要從主分支安裝。

Zala · CC BY-SA 4.0 · Image source
zh-Hant

OpenBMB 於 9 月 13 日集中發布 MiniCPM5‑2B 系列。名稱中的 2B 指約 19.82 億個非嵌入參數;完整模型共有 2,516,756,480 個參數、42 層,採 16 個查詢頭與 2 個 KV 頭的分組查詢注意力,原生上下文長度為 131,072 token。它沿用標準 `LlamaForCausalLM`,因此 Transformers、vLLM 與 SGLang 不必載入客製模型程式。

這次值得注意的不只是最終 checkpoint。團隊同步提供 Base、Midtrain、SFT 與 RL+OPD 版本,以及 BF16、GGUF、MLX 4-bit、GPTQ 4-bit、LiteRT 和多種晶片映像,讓研究者可追查能力在哪個訓練階段出現。OPD 把 16 個經 RL 訓練的專家模型壓回單一學生模型,其中五個針對代理任務;蒸餾時以師生完整詞彙分布的反向 KL divergence 作逐位置 advantage,不需另外製作蒸餾語料。官方稱 RL+OPD 對推理/通用能力平均增加 10.96 分,代理能力增加 6.96 分。

模型卡列出的綜合平均為 53.9,高於同表最高的 4B 級模型 51.1;LiveCodeBench v6 為 69.1,AIME 2025 為 86.5。不過這些是開發團隊自評,平均值混合多種尺度與任務,尚不能取代端側延遲、記憶體與真實工具成功率測試。部署上另有一個相容性陷阱:模型輸出 XML 式工具呼叫,文件雖稱 SGLang 已有 `minicpm5` parser,隨附部署技能卻指出 pip 版可能尚未包含它,需安裝 SGLang 主分支。工程團隊應鎖定 runtime commit,並分別驗證 128K 記憶體占用及 DSpark 推測解碼的實際接受率。

來源

  1. MiniCPM5-2B model card
  2. Deploy MiniCPM5-1B and MiniCPM5-2B with SGLang
  3. MiniCPM5 model collection