返回首頁

多模態生成

WithEveryone 以身分—版面綁定生成十人群像,但權重尚未開放

騰訊混元與復旦團隊提出 WithEveryone,先把每名參考人物綁定至結構化版面,再以區域化身分損失監督生成。它在作者建立的身分分離測試中提高人物覆蓋率並減少複製貼上痕跡,但現有基礎模型授權阻止團隊公開研究版權重。

Behrooz Rezvani · CC BY 3.0 · Image source
zh-Hant

多人物參考圖生成的難點不只是「臉像不像」,還包括每個身分是否出現在正確位置,以及訓練時如何把多張預測臉孔與參考人物一一配對。[WithEveryone](https://arxiv.org/abs/2608.20336)把這項問題拆成規劃與渲染兩段:每名參考人物先轉成可尋址的 identity token,模型接著預測包含人物區域、臉部區域及姿態資訊的身分—版面計畫,再把計畫作為視覺條件生成最多十人的群像。

核心訓練方法 Layout-Grounded ID Loss 不再用臉部 embedding 在多個預測區域間事後配對,而是利用已標註的臉部區域,直接把指定身分的損失施加到目標位置。另一項 ID Representation Forcing 會要求模型在開始合成影像前,先逐一預測每個身分的表示,降低長序列生成期間遺失人物的機會。這種顯式綁定也讓版面規劃、身分保存和最終渲染可以分別除錯。

在人物身分不與訓練集重疊的作者測試中,目標情境臉部相似度由 GPT-Image-2 的 0.462 提高至 0.499;複製貼上痕跡指標由 0.169 降至 0.055。系統涵蓋 97.3% 指定身分,重複人物率為 2.8%。這些數字顯示,多人物生成的主要瓶頸可能是可尋址規劃與監督對齊,而不只是增加臉部編碼器容量。

不過,[公開倉庫](https://github.com/doby-xu/WithEveryone)目前只有方法說明,沒有可執行程式碼或模型權重。團隊表示研究版建立在不允許再發布 checkpoint 的基礎模型上,正重新訓練可開放版本。因此現階段無法獨立核對速度、記憶體需求、失敗案例或評測實作;人臉相似度也不能代表姿態、手部、遮擋和文化情境均正確。後續真正值得觀察的是開放版本能否保留論文成績,以及版面控制在十人以上是否穩定。

來源

  1. WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
  2. Doby-Xu/WithEveryone