返回首頁

生成式影像模型

LLaDA-Image 以單一 6B 擴散模型統一生圖與編輯,Turbo 壓至 4 步取樣

螞蟻集團 inclusionAI 公開 LLaDA-Image 權重與 Diffusers 推論程式,單一模型同時處理文字生圖、參考圖編輯及中英文字渲染。蒸餾版以 Twin-DMD 將建議取樣步數由 50 降至 4,但訓練程式與獨立效能驗證仍未到位。

Raphael · Public domain · Image source
zh-Hant

inclusionAI 於 9 月 4 日釋出 LLaDA-Image Base、Turbo、FP8 權重與推論程式。論文將它描述為 6B 參數的統一影像模型:生成骨幹是從零訓練的 Diffusion Transformer,提示理解則交給凍結的 LLaDA2.0-Mini 視覺語言模組。同一檢查點可執行文字生圖、由 LLaDA2 產生離散視覺 token 的 VQ 條件生成,以及保留參考圖內容的指令式編輯,不必另接專用 editing backbone。

訓練流程沒有一開始便完全依賴圖文配對,而是先以純影像預訓練及中期訓練建立視覺先驗,再加入語言監督與生成、編輯聯合訓練。作者稱整體流程使用 2.2 億筆樣本,其中 9,800 萬筆為真實影像;DiT 採無參數 RMSNorm 與 Muon 最佳化器。Turbo 版再以 Twin-DMD 從 Base 蒸餾,把 50 步流程縮短為建議 4 步,官方亦提供 BF16、FP8 版本,降低權重載入的記憶體需求。

作者在 Qwen-Image-Bench 報告英文 53.53、中文 53.38,宣稱是開源模型最佳成績。這對需要中文字排版、生成與編輯共用管線的團隊頗有吸引力,但數字目前主要來自作者評測,尚未交代不同解析度的延遲、峰值顯示記憶體或 FP8 品質損失。更重要的是,論文稱完整訓練程式已公開,專案頁卻仍把它標示為「coming soon」;Hugging Face metadata 顯示約 7B 參數,也與論文的 6B 稱呼不完全一致。工程團隊應等待訓練碼、模型組成說明及第三方中英文字與編輯一致性測試,再判斷其可重現性。

來源

  1. LLaDA-Image official repository
  2. LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
  3. LLaDA-Image model card