GitHub Repo
Ollama 社群回報 MLX 混合量化載入缺陷,匯入成功仍可能無法推論
Ollama 0.35.1 的社群案例顯示,MLX 模型的逐層量化設定可能未被正確套用,導致載入時出現張量形狀錯配。模型配置可驗證確有混合精度設定,但根因與其他模型的影響範圍仍待上游確認。

10 月 4 日,Ollama 社群提出一項 MLX 模型相容性回報:在 Apple Silicon 上匯入混合精度權重時,建立模型的程序顯示成功,實際發送生成請求卻回傳 HTTP 500。案例使用 Ollama 0.35.1、M4 Pro 與 mlx-community/Qwen3-Coder-Next-4bit,透過實驗性匯入路徑建立模型;錯誤直到載入階段才浮現。問題回報
這份模型雖以「4bit」命名,配置並非所有層都採相同精度。公開的 config.json 指定全域 4 位元、每組 64 個元素,但在 48 層的 mlp.gate 與 shared_expert_gate 分別指定 8 位元,共有 96 項覆寫。模型配置也列出 512 個專家與 2048 維隱藏狀態,因此載入器需要保留逐層設定,才能正確解讀封裝後的權重。模型配置
MLX 文件說明,量化矩陣把多個權重值封裝在無號 32 位元整數內,縮放係數則按 group_size 分組。據此計算,同一個封裝寬度若從 8 位元誤讀為 4 位元,推定的邏輯寬度會加倍,所需縮放係數也跟著增加。回報中的權重形狀為 (512,512)、縮放係數為 (512,32);若套用 4 位元解讀,便會預期 64 欄縮放係數。這與回報者提出的根因一致,但尚不等於維護者已確認程式缺陷。MLX 運算文件
對本地推論部署而言,這個案例凸顯匯入成功與可執行之間的驗證缺口。工程團隊可在部署驗收加入最小生成請求,並核對逐層量化中繼資料與張量尺寸,避免大型權重寫入完成後才發現不相容。後續應觀察上游是否確認覆寫設定的處理方式、加入匯入前檢查,以及用混合精度模型建立回歸測試。截至查核,問題仍開啟;現有證據不足以推廣至所有 MLX 模型,也未證實會造成靜默的推論品質下降。目前狀態與重現步驟