返回首頁

最新模型

Qwen-Image-2.1 開放權重,原生支援透明圖像生成與編輯

新版整合文字生圖、多參考圖編輯與透明圖層,並重用前綴快取以減少重複計算。免費授權僅限研究與評估,商用須另取許可。

Internet Archive Book Images · No restrictions · Image source
zh-Hant

Qwen 團隊於 9 月 20 日公開 Qwen-Image-2.1 權重,把文字生圖、影像編輯及透明圖層處理放進同一模型。新版可接收最多十張參考圖,也能透過圈選、塗畫或遮罩指定修改位置,為多人物構圖與素材合成提供共同入口。[官方模型卡](https://huggingface.co/Qwen/Qwen-Image-2.1)

架構採用三十二層單流擴散 Transformer,視覺生成元件約七十億參數。推論的關鍵是重用文字與條件影像的前綴 KV 快取:這部分狀態跨去噪步驟保持固定,後續步驟便能集中計算目標圖像。這有助減少多參考圖編輯的重複運算,但七十億參數並不代表整套管線的顯存需求。[專案說明](https://github.com/QwenLM/Qwen-Image-2.1)

透明度也有實作層面的依據:公開 VAE 設定的輸入、輸出均為四通道,潛在表示為六十四通道,對應包含透明度的 RGBA 圖像。工程上可望減少生成後另外去背的步驟;實際能否直接交付素材,仍取決於髮絲、半透明物體與邊緣品質。測試時應把圖層疊到深色與淺色背景,檢查透明區域是否殘留顏色,以及輪廓是否產生白邊。[VAE 設定](https://huggingface.co/Qwen/Qwen-Image-2.1/blob/main/vae/config.json)

部署方面,Diffusers 已合併專用管線,官方範例採 BF16、四十次去噪,並提供模型卸載至 CPU 的方式。[部署範例](https://huggingface.co/Qwen/Qwen-Image-2.1) 程式審查亦曾修正快取切片仍占住整段張量儲存空間的問題,顯示快取策略必須同時驗證速度與記憶體生命週期。評估時應固定程式版本、解析度及參考圖數量,再比較端到端延遲與尖峰顯存。[整合與修正紀錄](https://github.com/huggingface/diffusers/pull/14804)

授權是導入前提。Qwen Research License 將免費使用限定於研究或評估,商業用途須另外取得許可;下載得到權重,並不等於取得商用權利。[授權原文](https://huggingface.co/Qwen/Qwen-Image-2.1/blob/main/LICENSE)

對中文設計流程,下一步值得測試繁體字形、長句排版,以及反覆編輯後的人物與商品一致性。中文提示理解與圖內文字正確率也應分開評估,避免把畫面美觀當成指令遵循能力。若加入提示改寫步驟,還要把額外模型的耗時與顯存計入測試。本次公開材料提供可重現的起點,尚不能據此推定中文素材的可用率,或所有硬體上的加速幅度。

來源

  1. Qwen-Image-2.1 官方模型卡
  2. Qwen-Image-2.1 官方儲存庫與發布紀錄
  3. Qwen-Image-2.1 VAE 設定
  4. Diffusers PR #14804:Add Qwen-Image 2.1
  5. Qwen Research License Agreement