最新模型
Qwen-Image-2.1の重みを公開、透過画像の生成・編集をネイティブにサポート
新版はテキストからの画像生成、複数の参照画像を使った編集、透過レイヤーの処理を統合し、プレフィックスキャッシュの再利用で重複計算を削減。無償ライセンスは研究・評価に限定され、商用利用には別途許可が必要。

Qwenチームは9月20日、Qwen-Image-2.1の重みを公開し、テキストからの画像生成、画像編集、透過レイヤーの処理を単一のモデルに統合した。新版は最大10枚の参照画像を入力でき、囲み指定、描き込み、マスクで編集箇所を指定することもできる。複数人物の構図作成や素材合成を共通の仕組みで扱える。[公式モデルカード](https://huggingface.co/Qwen/Qwen-Image-2.1)
アーキテクチャには32層のシングルストリーム拡散Transformerを採用し、画像生成コンポーネントのパラメータ数は約70億。推論の鍵となるのは、テキストと条件画像のプレフィックスKVキャッシュの再利用だ。この部分の状態はノイズ除去ステップ間で固定されるため、後続のステップでは生成対象の画像の計算に集中できる。これにより、複数の参照画像を使った編集で重複計算を減らせるが、70億というパラメータ数だけではパイプライン全体に必要なGPUメモリ容量は分からない。[プロジェクト概要](https://github.com/QwenLM/Qwen-Image-2.1)
透過対応には実装上の裏付けもある。公開されているVAE設定では、入力・出力はいずれも4チャネル、潜在表現は64チャネルで、透明度を含むRGBA画像に対応している。実装面では、生成後に別途背景を除去する工程を減らせると期待される。ただし、そのまま素材として納品できるかどうかは、髪の毛、半透明の物体、輪郭の品質に左右される。テストではレイヤーを暗い背景と明るい背景に重ね、透明領域に色が残っていないか、輪郭に白い縁が生じていないかを確認すべきだ。[VAE設定](https://huggingface.co/Qwen/Qwen-Image-2.1/blob/main/vae/config.json)
デプロイ面では、Diffusersに専用パイプラインがすでにマージされている。公式サンプルはBF16と40回のノイズ除去ステップを採用し、モデルをCPUにオフロードする方法も示している。[デプロイ例](https://huggingface.co/Qwen/Qwen-Image-2.1) コードレビューでは、キャッシュのスライスがテンソル全体のストレージを保持し続ける問題も修正された。これは、キャッシュ戦略では速度とメモリのライフサイクルを併せて検証する必要があることを示している。評価時にはコードのバージョン、解像度、参照画像の枚数を固定し、エンドツーエンドのレイテンシとGPUメモリのピーク使用量を比較すべきだ。[統合と修正の記録](https://github.com/huggingface/diffusers/pull/14804)
ライセンスの確認は導入の前提となる。Qwen Research Licenseでは無償利用が研究・評価に限定されており、商用利用には別途許可を得る必要がある。重みをダウンロードできることは、商用利用の権利を取得したことを意味しない。[ライセンス原文](https://huggingface.co/Qwen/Qwen-Image-2.1/blob/main/LICENSE)
中国語を使うデザインのワークフローでは、次に繁体字の字形、長文の組版、繰り返し編集した後の人物や商品の一貫性を検証する価値がある。中国語プロンプトの理解と画像内の文字の正確性も別々に評価し、見栄えの良さを指示に従う能力と混同しないようにすべきだ。プロンプトの書き換え工程を加える場合は、追加モデルの処理時間とGPUメモリ使用量もテストに含める必要がある。今回の公開資料は再現可能な検証の出発点を提供するが、これだけで中国語素材の実用に耐える割合や、あらゆるハードウェアでの高速化の度合いを推定することはできない。