開放模型
MiniCPM5-2B 開放權重與訓練資料,以 2.5B 參數挑戰本機代理工作負載
OpenBMB 發布具 131K 上下文的 MiniCPM5-2B,並同步開放約 8.6 萬筆可驗證強化學習資料。官方綜合成績高於比較表內部分 4B 模型,但評測由發布者執行,尚待獨立重現。

OpenBMB 於 9 月 7 日發布 MiniCPM5-2B。模型採標準 `LlamaForCausalLM` 密集架構,共 2,516,756,480 個參數,其中約 19.82 億為非嵌入參數;42 層、查詢/鍵值頭為 16/2 的 GQA,原生上下文長度為 131,072 token。權重與程式以 Apache 2.0 授權,另有 BF16、GGUF、GPTQ 4-bit、Apple Silicon MLX 及推測解碼用 DSpark 草稿模型。
部署路徑刻意貼近既有生態:Transformers、vLLM 與 SGLang 可直接載入,不要求專用核心或模型程式分支;GGUF 版本則面向 llama.cpp、Ollama 與 LM Studio。工具呼叫會先產生 XML 格式,再由 SGLang 的 `minicpm5` parser 轉成 OpenAI 相容的 `tool_calls`。這使它更像可嵌入桌面應用或邊緣代理的基礎模型,而不只是聊天權重。
訓練端同時揭露 UltraData-RL-2609,共 85,995 筆數學、程式、長上下文及知識任務。程式題以測試案例執行驗證,其餘多以答案比對或模型共識建立獎勵。最終模型再以 RL 與 OPD 合併 16 個專家模型;OPD 使用教師與學生完整詞彙分布的反向 KL 散度估算優勢,官方稱一般能力平均增加 10.96 分、代理能力增加 6.96 分。
官方比較表給出 53.9 的跨基準平均,高於表內 Qwen3.5-4B 的 51.1,並在 LiveCodeBench v6 得 69.1、AIME 2026 得 86.5。不過這些是不同任務、尺度與解碼預算的聚合結果,尚無獨立等條件重跑;131K 上下文也不等於全長皆維持同等準確率。工程團隊應先量測量化後的記憶體、長文退化、中文工具呼叫穩定度與真實裝置吞吐量,再判斷是否能取代較大的代理模型。