返回首頁

本地推論/開源執行期

llama.cpp 0.3.0 加入混合注意力 KV cache、MTP 與 DeepSeek 4 張量切分

llama.cpp 0.3.0 原生支援 dots3-note 的 DSA/滑動視窗混合注意力,並為 GLM-4.5-Air 接入多 token 預測。DeepSeek 4 現可使用張量切分橫跨多張 GPU,但發布說明沒有提供吞吐量、延遲或顯存比較。

The GGML authors · Public domain · Image source
zh-Hant

llama.cpp 發布 0.3.0,重點不是單一新模型,而是同時補齊三種較難落地的推論路徑。首先是 dots3-note:這個 288B 多模態 MoE 模型以 13 層動態稀疏注意力(DSA)配合 33 層滑動視窗注意力(SWA),DSA 每次選取最多 2,048 個位置,官方上下文上限為 512K。新版為這種交錯結構建立專用 DSA-ISWA KV cache,`mtmd` 亦可處理模型的圖像、影片與音訊輸入;WebP 解碼、影片尾端 `moov` atom 及與 Pillow 對齊的縮放演算法也一併修正。

第二項是 GLM-4.5-Air 的 MTP(multi-token prediction)支援。MTP 用額外預測頭一次提出多個後續 token,再由主模型驗證,可作為推測式解碼的草稿來源。這使使用者不必另載一個完整小型草稿模型,但實際接受率與加速幅度仍取決於提示內容、批次大小、量化格式及 MTP 權重是否齊全;0.3.0 發布頁沒有公布效能數字,因此不能直接宣稱固定倍數提升。

第三項是 DeepSeek 4 的 `-sm tensor`。過去常見的 layer split 把完整層分配到不同裝置,張量切分則把單一運算的權重分散到多張 GPU,可容納無法由整層均勻分配的模型並平衡顯存。代價是需要跨裝置歸約與同步,PCIe、RDMA 或後端通訊效率可能成為瓶頸;新版也修復多序列 rollback 與 meta-backend 切分狀態傳遞,顯示這條路徑此前仍有正確性風險。

底層 ggml 同步升至 0.22.0,加入 meta-backend 張量切分、Metal 逐算子核心和平行編譯等變更。對本地部署者而言,這版擴大了新型混合注意力、MTP 及巨型 MoE 的可執行範圍;下一步仍應在實際硬件上比較首 token 延遲、生成吞吐、KV cache 容量與多卡通訊成本,而不是只確認模型能載入。

來源

  1. llama.cpp v0.3.0 release notes
  2. dots3-note-prev-fp8 model card