AI 開源工具
Transformers 5.16 改用 DTensor 平行後端,並加入 NVFP4 與逐層 KV cache 設定
Hugging Face 新版把舊 tensor-parallel 實作換成 DTensor,並加入初步 pipeline-parallel 推論與 NVFP4 即時量化。升級同時改動 TP、Fuyu 及部分音訊模型行為,現有訓練與推論管線需要回歸測試。

Hugging Face 於 8 月 26 日發布 Transformers 5.16.0。相較新增模型支援,更值得部署團隊注意的是平行化、量化與 cache 介面的同步變動:舊有 tensor-parallel 後端已由 PyTorch DTensor 原生實作取代,涵蓋訓練與推論;原本的 `tp_plan` 路徑暫時恢復相容,但已進入棄用週期,不能視為長期介面。
新版亦加入一個標示為 naive 的 pipeline-parallel 推論引擎,可處理綁定或未綁定的輸入、輸出 embedding,並直接接入 `generate()`。這讓只依賴 Transformers 的團隊可以開始切分跨裝置模型,不過發布說明沒有提供吞吐量、泡沫比例、跨節點擴展或與 vLLM、SGLang 等專用 serving runtime 的比較,因此目前較適合作為功能基線,而非已證實的生產效能方案。
量化方面,5.16 經由 Hugging Face kernels 加入 NVFP4,可在載入期間把 BF16 權重即時量化;官方稱權重記憶體約減少一半。這個數字描述權重儲存,而不是整體服務顯存:KV cache、activation、量化 metadata、未支援算子及 kernel workspace 仍會佔用空間,實際節省也受 GPU 架構與模型覆蓋率影響。
針對混合注意力模型,新版允許每一層分別指定 `sliding_window`、`attention_chunk_size` 與 convolution state 數量,並修正滑動視窗 cache 的環回 off-by-one、Whisper 推測解碼 cache 損壞,以及僅量化 KV cache 的 compressed-tensors 載入問題。MoE 訓練則改為逐層計算 load-balancing loss,相關 PR 在 128K 設定下報告 one-hot 中間物件縮減 99.7%;這不是端到端訓練記憶體或速度提升數字。
升級並非完全向後相容。`FuyuProcessor` 不再輸出 `image_patch_indices`,部分語音模型開始正確派送 SDPA,舊 workaround 可能因此改變初始化行為。PyPI 套件附有 Trusted Publishing provenance 與 Sigstore attestation,但工程團隊仍應先固定 5.16.0,在實際 checkpoint 上驗證 TP 配置、cache 邊界、量化精度、生成一致性及峰值顯存,再逐步替換舊版服務。