本機推論與微調
Unsloth 0.1.807-beta 把 AMD APU 預設推論切至 Vulkan,Strix Halo 預填最高快 23%
Unsloth Desktop 改以 Vulkan 服務 Strix Halo、Strix Point 及缺乏 ROCm 的 AMD iGPU,並縮減 MLX KV cache 與安裝套件體積。效能數字來自官方測試,且已有使用者回報升級後介面仍顯示 ROCm,自動選路仍待實機驗證。

Unsloth 在 9 月 8 日發布 0.1.807-beta,把 AMD 本機推論的後端選擇、Apple Silicon 記憶體使用及容器交付一起重整。最具技術影響的變更,是 Strix Halo、Strix Point 預設改走 Vulkan;Linux 上沒有可用 ROCm 的 AMD iGPU,也不再直接退回 CPU。官方量測稱 Strix Halo 的提示處理最高提升 23%,生成最高提升 8%,但沒有交代模型、量化格式、上下文長度與功耗設定,因此不能把結果外推至所有 RDNA GPU。
Apple MLX 路徑則為量化 KV cache 宣稱最高減少 74%提示記憶體,gated-delta 模型訓練最高加速 25%,並加入 DoRA、更多 DPO loss 及可獨立抽樣的串流批次生成。這些修改的實際價值不只在峰值速度:較小的 KV cache 可讓統一記憶體 Mac 保留更長上下文或提高批量,而獨立抽樣修正了批次聊天彼此共用生成行為的風險。
發行版同時把預設 PyTorch 從 2.10 升至 2.11、簽署 Windows `llama-server.exe`、將 Python wheel 縮小 44%,並發布包含 PyTorch 2.11、CUDA 12.8、JupyterLab、llama.cpp 與 whisper.cpp 的 amd64/arm64 Docker 映像。容器的 `latest` 與 `studio` 是可移動標籤;需要可重現部署者應固定日期或版本標籤及 digest。
工程團隊仍應先做逐機驗證。發布當天已有 Strix Halo 使用者表示設定畫面仍顯示自動/ROCm,可能是介面標示、升級殘留設定或路由未生效。部署前宜記錄實際載入的後端、首 token 延遲、生成速度與輸出正確性;這仍是 beta 版,官方的「200 多項修正」也增加了回歸測試範圍。