返回首頁

開放權重模型/本機推論

Ling‑3.0‑tiny 每個 token 只啟用 1.3B 參數,但本機執行仍依賴專用 runtime 分支

InclusionAI 公開 7.9B 參數的 Ling‑3.0‑tiny,混合線性注意力與稀疏 MoE,並提供 BF16、FP8 及 INT4 權重。官方稱 FP8 在 M4 Pro 可達每秒 86 至 90 token,但 vLLM 與 Ollama 支援目前仍未完全進入上游穩定版本。

Shuang Zhang, Rui Fan, Yuti Liu, Shuang Chen, Qiao Liu, Wanwen Zeng · CC BY 4.0 · Image source
zh-Hant

InclusionAI 發布 MIT 授權的 Ling‑3.0‑tiny,定位是能在本機與邊緣設備執行的混合推理模型。它共有 7.9B 參數,但每個 token 僅啟用 1.3B;模型卡同時提供 BF16、FP8 與 INT4 權重,讓部署者在品質、記憶體與吞吐之間選擇。[官方模型卡](https://huggingface.co/inclusionAI/Ling-3.0-tiny)

架構並非單純縮小標準 Transformer。每四層以三層 Kimi Delta Attention(KDA)搭配一層 Multi-Head Latent Attention(MLA),試圖讓線性注意力承擔大部分長上下文計算,再由 MLA 補充內容相關的全域交互。FFN 則含 128 個路由專家;每個 token 選取八個專家並固定通過一個共享專家。模型可透過 `enable_thinking` 在快速回答與多步推理間切換,官方亦提供 256K YaRN 上下文及 NEXTN 推測解碼的 SGLang 配方。[SGLang 部署手冊](https://docs.sglang.io/cookbook/autoregressive/InclusionAI/Ling-3.0-tiny)

官方硬體測試稱,FP8 模型在 DGX Spark 輸出約 100 至 105 token/s,在 M4 Pro MacBook 約 86 至 90 token/s,8K 上下文的峰值記憶體約 8.34 GiB;Artificial Analysis Intelligence Index v4.1.1 與 Agentic Index 分別為 25、16。不過這些數字使用不同硬體與評測配方,不能直接互相比較,也尚不足以證明其長上下文品質或真實代理可靠度。

部署成熟度是目前最明顯的限制。SGLang 使用追蹤模型的開發映像;vLLM 安裝說明要求 InclusionAI 的 `ling_3_0` 分支;Ollama 支援仍位於 PR,且模型卡只確認 Apple Silicon 上的 MLX 路徑。模型目前也沒有 Hugging Face 推論供應商直接託管。工程團隊下一步應觀察 runtime 是否上游合併、INT4 實測品質、路由專家在長序列下的記憶體行為,以及社群能否獨立重現官方吞吐與代理評測。

來源

  1. inclusionAI/Ling-3.0-tiny Model Card
  2. Ling-3.0-tiny SGLang Cookbook
  3. inclusionAI/Ling Repository
  4. Ling-3.0-tiny community release thread