開源模型
LLaDA-Image 開放中英雙語生成與編輯模型,Turbo 將取樣壓至四步
InclusionAI 公開 LLaDA-Image 的 Base、Turbo 與 FP8 權重,讓同一模型支援文字生圖、參考圖編輯及中英文字渲染。論文詳列 2.2 億筆樣本的漸進訓練方法,但承諾的訓練程式碼目前仍未交付。

InclusionAI 於 9 月 4 日釋出 LLaDA-Image 系列的模型權重與推論程式。核心是從頭訓練的 6B Diffusion Transformer;完整管線加入凍結的 LLaDA 2.0 Mini 視覺語言模組後,Hugging Face 將整體檢查點標示為約 7B。文字提示先經 Residual Query Adapter、理解模型與連接器轉成 DiT 條件;進行圖片編輯時,參考圖則以 SigLIP-VQ 特徵及乾淨 VAE latent 直接送入 DiT,避免只靠語意編碼而遺失構圖與像素細節。
較有技術意義的是資料流程。團隊先以圖片自我條件化建立視覺先驗,再加入成對文字資料與生成、編輯聯合訓練;全部約 2.2 億筆生成樣本中,98% 為真實圖片,逾九成用於圖片單模態階段。模型以無可訓練參數的 RMSNorm 和 Muon optimizer 穩定訓練,Turbo 版再以 TwinFlow/分布匹配蒸餾,把 Base 建議的 50 次取樣降至 2 至 4 次。Base 在作者執行的 Qwen-Image-Bench 中,英文與中文總分分別為 53.53、53.38,宣稱位居開源模型首位;Turbo 則以部分品質交換延遲。
工程端可直接用 PyTorch 2.8、Diffusers 0.39 載入 BF16 或 FP8 權重,單一檢查點涵蓋文字生圖、VQ 條件生成及指令式編輯。需要保留兩項警訊:榜單尚缺獨立重現,而儲存庫雖稱「完整開放訓練配方」,截至發布時只有推論程式與權重,訓練程式碼仍標示 coming soon。下一步應觀察訓練碼是否足以重建各階段,以及 FP8 在中文字形、長文字和參考圖一致性上的實際退化。