返回首頁

推論系統

Unsloth 0.1.806 預設啟用 MTP 推測解碼,Qwen3.8 與 GLM-5.3 本機推論最高快兩倍

Unsloth 為 Qwen3.8-Flash-Next、GLM-5.3-Flash 預設開啟多 token 預測,並改善 MLX、多 GPU 與 ROCm 路徑。官方最高兩倍的說法未附完整測試矩陣,Qwen 技術文件所列低併發增益則為 1.3 至 1.7 倍。

The GGML authors · Public domain · Image source
zh-Hant

Unsloth 釋出 0.1.806-beta,把 MTP(Multi-Token Prediction)推測解碼預設套用於 Qwen3.8-Flash-Next 與 GLM-5.3-Flash。其做法是由額外的 draft head 一次預測數個後續 token,再交給主模型在單次前向傳遞中驗證;被接受的候選可直接輸出,遭拒者則回到主模型結果。這不改變驗證後的輸出,主要收益來自減少每個 token 都完整執行一次主模型的成本。

Qwen 的部署文件建議使用 2.60 GB、可借用主模型 embedding 與輸出投影的 shared-Q8_0 draft head,較自帶投影層的版本節省約 1.3 GB。文件估計低併發速度提高約 1.3 至 1.7 倍,並建議 `--spec-draft-n-max 2`;拉長草稿會增加候選數,卻可能因接受率下降而倒退。這也解釋為何版本標題的「最高兩倍」不能直接外推至所有提示、量化格式或並行負載。

部署仍有明顯限制:標準版 llama.cpp 尚未具備 qwen4exp 的 MTP graph、跨模型張量借用及相應參數,使用者必須採用 Unsloth 預編譯版本、其分支,或仍待合併的上游 PR。draft head 又位於 MTP 子目錄,必須以 `-md` 明確指定,否則可能無警告地退回一般速度。

同一版亦改善 Apple Silicon 的 MLX 長對話快取、模型切換後的顯存釋放、多 GPU 自動放置、ROCm 安裝,以及工具呼叫與 MCP 連線。但這些項目多為供應商描述,工程團隊應以自身上下文長度、量化、草稿接受率、首 token 延遲和併發數重新量測,尤其不能把單工作槽增益視為伺服器吞吐量增益。

來源

  1. Unsloth v0.1.806-beta release notes
  2. MTP draft heads for Qwen3.8-Flash-Next