返回首頁

推論系統

Apple Silicon 跑混合式 Qwen 的最佳化鏈仍斷裂:MLX 轉換未完整保留 MTP

社群實測指出,Apple Silicon 推論框架仍無法同時穩定提供內建 MTP 推測解碼、混合狀態前綴快取與批次服務。問題不只影響跑分,也會令長時程式代理在每輪對話重新支付 prefill 成本。

Raimond Spekking · CC BY-SA 4.0 · Image source
zh-Hant

Apple Silicon 本機推論目前缺的不是單一高速 kernel,而是一條能把模型權重轉換、狀態快取與推測解碼串起來的完整路徑。最新社群調查以 Qwen3.8-27B 等混合式模型為例:模型同時包含注意力 KV cache、循環狀態及內建 multi-token prediction(MTP)頭,但 `mlx-lm` 的標準轉換與載入流程尚未原生處理整套 MTP 權重與執行邏輯。既有 GitHub 討論亦確認,MTP 元件可能不會在一般 MLX 轉換/量化路徑中保留下來;另有重現案例顯示,`qwen3_5_mtp` 類型甚至會在伺服器載入階段因未註冊而失敗。

替代方案同樣有取捨。`vllm-metal` 已提供 paged KV、連續批次與部分自動前綴快取,但官方支援表仍把 Qwen3.5/3.6 這類混合 GDN 模型列為不能使用 automatic prefix cache。推測解碼若要在草稿被拒絕時回滾,不只要撤銷 KV,還須還原循環狀態;驗證多個草稿 token 時,Metal kernel 又可能重複讀取整段快取。因此,有些框架可展示短提示下的 MTP 加速,卻無法保證長對話、共享 system prompt 或多代理併發仍有相同收益。

工程團隊評估 Mac 推論時,應把多輪 TTFT、32K 以上上下文、快取命中後的 TPOT,以及 MTP 接受率一併量測,不能只看單輪 tokens/s。接下來值得觀察的是 `mlx-lm` 是否合併原生 MTP 權重保存與批次生成支援,以及 `vllm-metal` 能否為混合循環狀態同時啟用前綴快取和推測解碼。現有結論主要來自社群測試及快速演進中的文件,尚不是跨機型、跨框架的受控比較。

來源

  1. SOTA Apple Silicon Inference (August 15, 2026)
  2. Internal MTP for Qwen3-based and Nemotron-based models
  3. vllm-metal supported models