返回首頁

推論系統

llama.cpp b10448 原生接入 Kimi K3,MXFP4 無損重排避開 5.5TB BF16 中轉

新版加入 Kimi K3 的文字模型、混合 KDA/MLA 注意力、latent MoE 與工具呼叫解析。轉換器直接重排 MXFP4 位元配置,毋須先展開整個 2.8T 模型至 BF16。

The GGML authors · Public domain · Image source
zh-Hant

llama.cpp 的 b10448 已加入 Kimi K3 文字模型支援,重點不只是辨識新架構名稱,而是把這款 2.8T 參數模型特有的混合推論路徑接進 GGML 圖。K3 交錯使用線性 KDA 與完整 MLA 注意力,另有跨層 residual attention、896 個 latent experts 中每 token 選取 16 個、SiLU 型態以外的新 activation、MLA 輸出閘門及不同形式的 KDA decay gate。由於模型內部 `text_config` 仍回報較舊的 Kimi Linear 架構,llama.cpp 必須改從頂層名稱路由,否則會套用錯誤模型定義。

部署上的關鍵改動是量化權重轉換。官方 checkpoint 採 compressed-tensors 的 `mxfp4-pack-quantized`;其數值編碼與 GGML MXFP4 相同,差異只在 block 內 nibble 排列。新版因此直接做位元重排,作者驗證反量化誤差為零,而不是先展開成約 5.5TB 的 BF16 權重再重新量化。重排亦採延遲執行,避免 GGUF writer 在輸出前同時保留全部轉換張量。

聊天層同步加入 K3 的 XTML 式 reasoning、response 與 typed tool-call 解析,並以完整模型在八張 B200 上驗證串流內容、推理欄位及停止原因。限制是跨層 residual 算子目前只有 CPU 與 CUDA 核心;Metal、Vulkan 會逐節點回退,不能把「可載入」等同於各後端已有良好效能。後續應觀察社群 GGUF 的實際容量、KDA 狀態記憶體,以及非 CUDA 核心補齊速度。

來源

  1. llama.cpp b10448 release
  2. Kimi K3 model card
  3. Kimi K3: Open Frontier Intelligence