返回首頁

開源模型/端側 AI

MiniCPM5-2B 開放訓練資料與端側部署格式,但量化版取樣預設值遭質疑

OpenBMB 發布具 13.1 萬 token 上下文與工具調用能力的 2B 稠密模型,並同步公開分階段權重、訓練資料及多種量化格式。第三方評測肯定其同級競爭力,但社群測試發現官方取樣設定可能讓 GGUF 量化版陷入重複生成。

Zala · CC BY-SA 4.0 · Image source
zh-Hant

OpenBMB 發布 [MiniCPM5-2B](https://huggingface.co/openbmb/MiniCPM5-2B),定位為可在端側執行的文字推理與代理模型。它採標準 `LlamaForCausalLM` 架構,共 42 層、約 25.2 億個參數,其中約 19.8 億為非嵌入參數;GQA 配置為 16 個查詢頭、2 個 KV 頭,上下文上限為 131,072 tokens。Apache 2.0 權重之外,團隊也提供 Base、Midtrain、SFT 與 RL/OPD 完成版檢查點,以及 GGUF、MLX、GPTQ、LiteRT 和 DSpark 草稿模型。

這次發布較有研究價值之處是資料與後訓練鏈一併開放。官方列出網頁預訓練資料 UltraX、分級程式碼資料、50 萬筆代理 SFT 樣本及逾 8 萬筆數學、程式與長上下文 RL 樣本。後訓練先進行 SFT,再訓練數學、程式、代理等專家,最後用 On-Policy Distillation 合併 16 個 RL 專家;其方法以師生模型完整詞彙分布的反向 KL divergence 建立 advantage,而非只依答案驗證器給分。

官方自選評測的平均分為 53.9,高於表中數款較大的對照模型;獨立的 [Artificial Analysis](https://artificialanalysis.ai/models/minicpm5-2b/) 頁面目前則給出 Intelligence Index 15,仍列為 4B 以下開放權重模型第一。兩套聚合方式、提示與推理預算不同,數字不可直接互換,而且尚無受測 API 供應商的速度、首 token 延遲或成本資料。

部署端也已有重要警訊。一名使用者依官方 `temperature=1.0、top_p=0.95` 設定,在 RTX 3060 上測試官方 Q8 與 Q4 GGUF,回報未加 repeat penalty 時大量輸出陷入循環;加入約 1.15 的懲罰後明顯改善。這只是單機、單一程式評測且含修復輪次的社群結果,不能視為通用最佳值,但工程團隊在採用模型卡預設值前,應針對實際量化格式測試重複率、停止條件、工具調用成功率與長上下文記憶體占用。

來源

  1. MiniCPM5-2B model card
  2. MiniCPM5-2B Intelligence, Performance & Price Analysis
  3. MiniCPM5-2B sampling defaults omit repeat-penalty
  4. China's Latest AI Model Brings General-Purpose Agentic Capability to Edge Devices