ホームへ戻る

生成模型研究

擴散蒸餾只對齊最終 CFG 速度可能掩蓋分支錯誤,PDM 改為分別約束正向預測與條件方向

新研究發現,on-policy 擴散蒸餾若只匹配 classifier-free guidance 合成結果,正、負分支的誤差可能互相抵銷。Positive-Direction Matching 將兩者拆開監督,在密集到稀疏的影片控制實驗中降低模型對推論 guidance scale 的敏感度。

zh-Hant

Classifier-free guidance(CFG)會把條件分支與負向或無條件分支的預測線性組合,是圖像及影片擴散模型控制提示遵循度的標準做法。當研究者以 on-policy distillation(OPD)把大型教師蒸餾到較小或較稀疏的學生模型時,常見方法直接要求學生匹配教師經 CFG 合成後的速度向量。新論文指出,這個目標只限制合成結果,並沒有唯一決定兩個分支各自應學到什麼。

問題在於誤差可以互相抵銷:學生的正向分支偏向一側,負向分支只要以適當幅度偏向另一側,最終 guided velocity 仍可能接近教師。若教師與學生共用相同的負向條件結構,傳統方法可能仍然有效,因為兩邊誤差可同步下降;但當教師的負向分支含有學生拿不到的資訊時,作者觀察到兩個分支形成對抗動態——正向誤差下降,負向誤差反而上升。研究將此稱為 Negative Branch Asymmetry(NBA)。

團隊提出 Positive-Direction Matching(PDM),不再只監督 CFG 合成向量,而是分別約束正向預測,以及正、負分支之間的條件方向。這等於把原本欠識別的蒸餾目標拆成兩項可判別條件。作者將方法用於 dense-to-sparse 影片控制:教師取得較密集的控制訊號,學生只接收稀疏訊號。傳統 guided matching 的結果會隨推論時 guidance scale 明顯變動,PDM 則呈現較穩定的知識轉移。

這項工作提醒生成模型工程師,部署時看似單一的 CFG 輸出,背後可能隱藏品質脆弱的分支。它目前仍是預印本,公開摘要也未提供足以比較訓練成本、影片品質與跨模型泛化的完整數字。下一步應檢查程式與權重是否公開、在不同 CFG schema 和基礎模型上重現 NBA,並確認分支穩定性是否真的轉化為更好的時序一致性、控制精度及人類偏好。

出典

  1. Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
  2. Daily Papers: Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation