開源模型與框架
Transformers 5.17 統合六種模型架構,Vision RoPE 重構要求自訂模型遷移
新版讓 HYV4、KimiLinear、NeoMME 及三種語音架構進入標準 `from_pretrained` 路徑,並降低生成迴圈的裝置同步開銷。另一方面,2D/3D Vision RoPE 被集中至共用模組,依賴舊式網格與頻率計算的自訂模型可能直接失效。

Hugging Face 於 9 月 9 日上傳 [Transformers 5.17.0](https://pypi.org/project/transformers/5.17.0/),把六種原先需要專用或遠端程式碼的架構納入框架。語言模型部分包括 HYV4 Preview 與 KimiLinear;前者是官方文件所述的 780B MoE,每個 token 啟用約 49B 參數,後者以多數 Kimi Delta Attention 層配合週期性的 MLA 完整注意力。HYV4 檢查點內的多 token 預測層目前不執行,載入時會忽略相關權重,不能把「可載入」等同於完整重現原始推論堆疊。
多模態方面,NeoMME 以單一雙向 Transformer 編碼文字 token 與原始影像 patch,並包含面向文件搜尋的 late-interaction/dense 聯合目標版本。語音新增 VibeVoice、Fun-ASR-Nano 與 Canary-1B-v2,分別涵蓋長篇多講者合成、中英日及方言口音辨識,以及多語轉錄和語音翻譯。這些整合的實際價值是共用 AutoClass、處理器與部署介面,而不是宣告各模型品質已經過框架團隊獨立驗證。
本次最需留意的破壞性變更是 Vision RoPE。框架把視覺模型各自的 2D/3D rotary frequency 計算集中至 `modeling_rope_utils.py`;若下游模型覆寫 attention 層、自行建立位置網格,或依賴舊參數形狀,升級後可能產生載入錯誤,甚至出現不易察覺的輸出偏移。部署者應用固定影像、位置索引與 logits 快照做回歸,而不能只確認權重成功載入。
生成層亦移除每個解碼步驟不必要的加速器同步,並修復遠端檔案下載、VibeVoice 量化快取及無快取 paged attention 的問題。這些修正可能改善延遲和正確性,但目前沒有跨硬體端到端基準;工程團隊下一步應觀察各新模型的專用推論後端支援,以及 Vision RoPE 遷移後的相容性回報。