推論與量化
Nunchaku Lite 原生進入 Diffusers,以 W4A4 量化降低擴散 Transformer 顯存與延遲
Diffusers 現可直接載入 Nunchaku Lite 的 INT4 與 NVFP4 檢查點,不必另裝模型專用推論引擎。SVDQuant 同時量化權重與啟用值,目標是在節省顯存之外真正縮短去噪時間。

Hugging Face Diffusers 新增 Nunchaku Lite 原生載入路徑,讓使用者以一般 `from_pretrained()` 介面執行 SVDQuant 檢查點。傳統 weight-only 量化會在計算前把低精度權重反量化,雖節省顯存,卻未必改善延遲;SVDQuant 則把啟用值離群部分移入權重,以小型 16 位元低秩分支保留難以量化的訊號,再讓主要線性層以 W4A4 執行。對正規化與調變等精度敏感層,整合採用 W4A16 AWQ。
新路徑會在載入權重前,將標準 Diffusers 模型的相容 `nn.Linear` 模組替換為 SVDQ 或 AWQ 執行層,CUDA kernel 由 Hugging Face `kernels` 套件下載,不需本機編譯。官方在 RTX PRO 6000 Blackwell、1024×1024 ERNIE-Image-Turbo 測試中,峰值顯存由 31.1 GB 降至最低 16.0 GB;僅用 NVFP4 時完整流程為 2.27 秒,加上 `torch.compile` 後為 1.68 秒,BF16 基準為 3.00 秒。
通用性也帶來取捨:Nunchaku Lite 不會自動完成 QKV 融合等架構特定改寫,因此基本路徑約快 30%,仍可能慢於原版 Nunchaku 的專用融合核心。NVFP4 僅支援 Blackwell,較舊 NVIDIA GPU 要改用 INT4,Volta 與 Hopper 目前未納入其四位元核心支援。團隊應在目標模型上重新量測畫質、LoRA 相容性、編譯時間與批次吞吐,不能把單一影像模型的數據直接外推。