推論與量化
Diffusers 原生接入 Nunchaku Lite,以 W4A4 核心降低擴散模型顯存與延遲
Hugging Face Diffusers 現可直接載入 Nunchaku Lite 檢查點,以 4-bit 權重與啟用值執行擴散 Transformer。官方單機測試最高把峰值顯存約減半並達 1.8 倍加速,但硬體覆蓋及畫質驗證仍有限。

Hugging Face 在 7 月 23 日公開 Nunchaku Lite 的 Diffusers 原生整合,讓開發者能用一般 `from_pretrained()` 載入 SVDQuant 量化的擴散模型,不必另外維護 Nunchaku 推論引擎,也毋須在本機編譯 CUDA extension。核心算子由 Hugging Face `kernels` 套件下載;模型倉庫則在 `config.json` 內記錄量化方法、精度、group size、低秩 rank 與目標模組,因此量化檢查點仍可沿用 Diffusers 的 scheduler、LoRA、CPU offload及 `torch.compile` 流程。
多數 weight-only 量化會在運算時把權重還原至較高精度,主要節省顯存,未必縮短延遲。Nunchaku Lite 對注意力與 MLP 投影採 SVDQ W4A4:先把難以量化的 activation outlier 吸收到權重,再以小型 16-bit 低秩分支修正,剩餘矩陣則使用 4-bit 權重與啟用值;較敏感或受記憶體頻寬限制的調變層改用 AWQ W4A16。Diffusers 會在載入權重前,把指定的 `nn.Linear` 換成對應執行期模組。
官方在 RTX PRO 6000 Blackwell、1024×1024 的 ERNIE-Image-Turbo 測試中,BF16 管線耗時約 3.00 秒、峰值顯存 31.1 GB;NVFP4 版本降至 2.27 秒與20.6 GB,配合 `torch.compile` 後約 1.68 秒。量化文字編碼器時,顯存可再降至約 16 GB。這些結果仍是單一模型、GPU與提示設定下的團隊測試;NVFP4 只支援 Blackwell,較舊 Turing、Ampere與Ada需用 INT4,Volta及Hopper目前不支援。此外,通用 Lite 路徑缺少原版 Nunchaku 的模型專用 QKV與MLP融合,追求極致吞吐的部署仍可能需要架構專用 adapter。