開放模型與生成式影像
Microsoft、Mage-Flowをオープン化:4Bモデルがネイティブ解像度パイプラインで画像生成と指示ベース編集を統合
Mage-Flowは、軽量なMage-VAE、ネイティブ解像度対応MMDiT、rectified flow matchingを組み合わせた40億パラメータの画像モデルだ。MicrosoftはMITライセンスで重みを公開し、生成版と編集版も提供しているが、品質比較や効率性の数値は現時点で主にチーム自身の評価に基づいている。

Microsoftの研究チームは、約40億パラメータのオープンな画像生成スタック「Mage-Flow」を発表した。テキストからの画像生成と、指示に基づく既存画像の編集の両方に対応する。モデル、Turboバリアント、ベースチェックポイントはHugging FaceでMITライセンスの下、公開されている。研究の重点は拡散Transformerをさらに大規模化することではなく、画像tokenizer、モデルバックボーン、トレーニングコアを共同設計し、より現実的なファインチューニングおよびデプロイ予算の範囲内で品質を維持することにある。
最初のコンポーネントであるMage-VAEは、軽量な潜在表現エンコーダーだ。論文では、1ステップの拡散ベースのエンコード/デコードとanchor-latent KL正則化を用いることで、画像を圧縮しながら再構成品質を維持し、生成パイプラインの両端における計算コストを削減している。2つ目のコンポーネントはNative-Resolution MMDiTだ。異なるサイズと長さの画像tokenおよびテキストtokenをパッキングして処理するため、トレーニングや推論のすべての入力を、事前に固定された正方形の解像度へクロップまたは引き伸ばす必要がない。デュアルストリームブロックがテキスト表現と視覚表現をそれぞれ処理し、アテンション演算の中で情報を交換する。
モデルはrectified flow matchingでトレーニングされ、同一のスタックを共有して、画像生成版のMage-Flowと編集版のMage-Flow-Editが派生している。チームは、可変シーケンス長でのトレーニング効率を改善するため、融合カーネルも使用している。開発者にとって重要なのは、生成と編集のために、それぞれ100億超から数百億パラメータ規模の独立したアーキテクチャを保守する必要がない点だ。ネイティブアスペクト比でのパッキングは、ポスター、縦長画像、ワイドシーンなど、標準外のキャンバスにも適している。
ただし、「より大規模なモデルに匹敵する」という主張は慎重に解釈する必要がある。論文のOneIG、テキストレンダリング、編集ベンチマークは、著者が選定したプロンプト、評価器、推論設定に基づいており、実際のワークフローにおけるブラインドテストの選好と同義ではない。また、40億パラメータだからといって、一般消費者向けGPUでネイティブな高解像度画像を必ず低レイテンシで処理できるわけではない。VRAM使用量は依然として、キャンバスサイズ、token数、サンプリングステップ数の影響を受ける。今後は、DiffusersやComfyUIなどのエコシステムへのネイティブ統合に加え、中国語テキスト、複数人物の構図、局所編集の一貫性、実際のVRAM使用量について、コミュニティがどのような再現結果を示すかが注目される。