返回首頁

開放模型與生成式影像

Microsoft 開放 Mage-Flow:4B 模型以原生解析度管線統一圖像生成與指令編輯

Mage-Flow 把輕量 Mage-VAE、原生解析度 MMDiT 與 rectified flow matching 組成 40 億參數圖像模型。Microsoft 已釋出 MIT 授權權重及生成、編輯版本,但品質比較和效率數字目前仍主要來自團隊自評。

Coolcaesar · CC BY-SA 4.0 · Image source
zh-Hant

Microsoft 研究團隊發布 Mage-Flow,一套約 40 億參數的開放圖像生成堆疊,同時覆蓋文字生圖與依指令編輯既有圖像。模型、Turbo 變體及基礎檢查點已放上 Hugging Face,採 MIT 授權;研究重點不是繼續放大擴散 Transformer,而是共同設計圖像 tokenizer、模型骨幹與訓練核心,試圖在較現實的微調和部署預算內維持品質。

第一個元件 Mage-VAE 是輕量潛在表示編碼器。論文以單步擴散式編碼/解碼及 anchor-latent KL 正則化,在壓縮圖像的同時保留重建品質,減少生成管線兩端的運算成本。第二個元件是 Native-Resolution MMDiT:它把不同尺寸、長度的圖像與文字 token 打包處理,避免所有訓練和推論輸入都先裁切、拉伸至固定方形解析度。雙串流區塊分別處理文字與視覺表示,再於注意力運算中交換資訊。

模型以 rectified flow matching 訓練,並共用同一套堆疊衍生 Mage-Flow 生圖版與 Mage-Flow-Edit 編輯版。團隊亦使用融合核心改善變動序列長度下的訓練效率。對開發者而言,重要之處是生成與編輯不必各維護一個十多億至數百億參數的獨立架構;原生比例打包也較適合海報、長圖、寬幅場景等非標準畫布。

不過,「媲美更大模型」仍須審慎解讀。論文的 OneIG、文字渲染及編輯基準來自作者選定的提示、評分器和推論設定,不等同真實工作流中的盲測偏好;40 億參數也不代表一般消費級 GPU 必然能以原生高解析度低延遲執行,顯存仍會受畫布大小、token 數及取樣步數影響。接下來值得觀察 Diffusers、ComfyUI 等生態的原生整合,以及社群對中文文字、多人構圖、局部編輯一致性和實際顯存占用的重現結果。

來源

  1. Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
  2. microsoft/Mage-Flow Model Card
  3. Mage-Flow open-source release timeline entry