返回首頁

生成模型訓練

DiffusionOPSD 將影像獎勵改造成逐步去噪目標,訓練 GPU 時數最多減少 63%

ByteDance Seed 的方法不再把終點獎勵直接套到所有去噪步驟,而是以獎勵梯度建立正負乾淨影像預測目標。它在兩種骨幹的 20 組配對測試中取得 19 組最佳成績,但結果仍主要依賴自動獎勵模型及作者自行量測。

Tea person · CC BY-SA 4.0 · Image source
zh-Hant

擴散模型的偏好後訓練通常只在完整影像產生後取得獎勵,卻要把同一訊號歸因到整條去噪軌跡。ByteDance Seed 提出的 [DiffusionOPSD](https://arxiv.org/abs/2608.24646) 改用 on-policy self-distillation:每輪先凍結 behavior policy 產生軌跡,從中抽取帶噪 query state 與乾淨輸出預測 anchor,再沿影像獎勵梯度,在 anchor 周圍建立有界的正、負目標。可訓練 policy 把這些目標視為停止梯度的監督訊號,完成有限次擬合後,再以指數移動平均更新 behavior policy。

這項分層設計的技術價值不只在分數。研究者可分開量度「獎勵梯度是否找到較佳目標」與「模型經一次實際更新後能否實現該改善」。論文的同 query 實驗顯示,建構階段改善較大的目標,有限次參數更新後不一定帶來較大收益,指出擴散 RL 中目標品質與可學習性不是同一問題。

作者在 SD3.5-M 與原生九步的 Z-Image-Turbo 上,以十種評估器進行獎勵配對比較。DiffusionOPSD 在 20 組 held-out 比較中取得 19 組最佳最終分數,相對最強基線最高改善 44%。以八張 GPU 的逐步時間重新估算,每 100 次更新分別需要 28.2 與 149.8 GPU 小時,較 DiffusionNFT 少 40% 與 63%;不過 Z-Image-Turbo 的峰值顯存並沒有同步下降。

[公開程式](https://github.com/worldbench/DiffusionOPSD)包含 SD3.5-M、Z-Image-Turbo、ReFL、FlowGRPO 與 DiffusionNFT 的訓練配置,也固定了 25,415 條 Pick-a-Pic 提示詞的 manifest;另有三個 LoRA checkpoint,可重跑 DrawBench held-out 評估。限制是主要證據仍來自兩個骨幹、文字生圖及自動偏好評估器,容易受 reward over-optimization 影響;其中一個 pointwise checkpoint 對應的論文評估器也未收入程式庫。下一步應觀察獨立重現、人工偏好測試,以及方法能否延伸至影片或編輯模型。

來源

  1. On-Policy Self-Distillation in Diffusion Models
  2. DiffusionOPSD source code and reproduction recipes
  3. DiffusionOPSD project page
  4. DiffusionOPSD LoRA adapters