返回首頁

AI inference runtimes

Diffusers 0.40 將 Modular Pipeline 轉為穩定 API,同時移除 JAX/Flax

Hugging Face 讓 MiniMax H3、MiniMax Music 3 及 Wan-Animate-2 直接以可組合區塊接入,不再提供傳統 DiffusionPipeline 封裝。新版也加入有限的 tensor parallel、低位元量化後端及安全修補,但帶來 Flax 移除與 LoRA 輸出變動。

組曲師 (talk · contribs) · Public domain · Image source
zh-Hant

Hugging Face 發布 [Diffusers 0.40.0](https://github.com/huggingface/diffusers/releases/tag/v0.40.0),最具結構性的改動是 Modular Diffusers 不再標示為實驗功能。新架構把文字編碼、條件處理、去噪、卸載與解碼拆成可組合 block;MiniMax H3、MiniMax Music 3 及 Wan-Animate-2 更只提供 modular pipeline,沒有對應的傳統 `DiffusionPipeline`。這意味新模型整合開始依賴工作流圖,而不是為每種輸入組合複製一個大型 pipeline 類別。

以 MiniMax H3 為例,同一模型庫容納文字轉影音、首尾影格條件及多媒體參考三種工作流;`from_pretrained` 可在載入時裁剪工作流,只宣告及下載相關 checkpoint 分區。由於其 Transformer 與 Qwen3-VL conditioner 都超過 60GB,官方範例使用 `ComponentsManager` 在 CPU 與 GPU 間逐段搬移元件。0.40 亦讓 group offload 配合自動卸載,並讓 CLI 儲存自訂 block、選擇 workflow 及輸出批次影音。

核心執行層新增 CUDA 與 AWS Neuron 的 tensor parallel 公開介面,但目前預設切分計畫只覆蓋 FLUX.1、FLUX.2 與 Qwen-Image,尚不能解讀為所有模型均可直接擴展。量化方面加入 SDNQ,支援 INT8 至 2-bit、FP8、SVD 修正及 Hadamard rotation,另可載入 Nunchaku Lite 預量化權重。

遷移風險同樣明顯:全部 JAX/Flax 類別及 extras 已被刪除;`torch_dtype` 改為棄用;混合 rank 且沒有 alpha 的 LoRA 現會以正確的逐模組尺度載入,舊專案的輸出因此可能改變。新版還修補分片 checkpoint 索引造成的路徑穿越與目錄外檔案讀取。工程團隊升級前應保存固定種子的影像回歸結果,並檢查自訂 pipeline、LoRA 與 Flax 相依項,而非只確認程式能成功匯入。

來源

  1. Diffusers 0.40.0 release notes
  2. MiniMax-H3 pipeline documentation
  3. diffusers 0.40.0 package