返回首頁

本地推論/模型量化

Qwen3.8‑27B GGUF 改用逐張量配置,同一量化名稱不再代表舊版位元分配

Bartowski 重新上傳 Qwen3.8‑27B GGUF,依各張量敏感度分配量化格式,並公開可重建的配置檔與 KLD 測量。新舊檔案共用部分名稱,但 `_L` 的語意及實際位元配置已改變,部署者不能只比檔名。

Bartowski Krzysztof · CC0 · Image source
zh-Hant

Hugging Face 社群量化維護者 Bartowski 已用新的 per-tensor layout 重建 Qwen3.8‑27B GGUF。傳統 llama.cpp 規則依張量名稱與模型類型套用固定量化格式;新流程先用跨模型量測得到的敏感度先驗,再把額外位元配置給對量化誤差更敏感的權重。每個模型仍要通過「canary」檢查:若新配置在 Kullback–Leibler divergence 對檔案大小的曲線上沒有優於基準,就退回原本的啟發式規則。

這次發布不只提供成品。每個適用檔案都附上實際交給 `llama-quantize --tensor-type-file` 的張量清單,以及記錄產生器、llama.cpp 版本與 commit 的 JSON,因此其他人至少能重建位元配置。Qwen3.8‑27B 的模型卡顯示,按相同檔案大小的標準配置曲線比較,Q6_K、Q4_K_M、Q3_K_M 與 IQ2_XXS 的 KLD 比率分別為 0.96、0.94、0.79、0.78;比率低於 1 代表在其測量方法下位元效率較佳,而非模型任務分數同比提升。

命名相容性是最容易踩到的地方。新的 S、M、L 表示約有 90%、70%、50% 的模型主體維持基礎量化型別,其餘空間依敏感度加碼;`Q4_K_L`、`Q6_K_L` 因而不再只是把 embedding 與 output 權重保留為 Q8_0。舊有 `Q2_K_L`、`Q3_K_XL`、`Q5_K_L` 沒有重建,卻仍留在儲存庫,任何自動下載腳本都應同時固定 revision、SHA256 與精確檔名。

新量化仍保留影像 projector 與 MTP 層,可在近期 llama.cpp 以 `--spec-type draft-mtp` 啟用推測解碼。不過公開證據主要是維護者在固定文字樣本上的 perplexity、KLD 與 top-p 一致率,尚未涵蓋中文、程式碼、視覺或工具呼叫的任務級評測。工程團隊應把這批檔案視為更透明的量化候選,而不是已證明全面優於舊版的直接替換品。

來源

  1. Per-tensor layout maps for GGUF quantization
  2. Qwen3.8-27B-GGUF model card and updated layouts
  3. llama.cpp repository
  4. Community release discussion: updated per-tensor layout