返回首頁

生成模型與推論最佳化

OYS 直接搜尋擴散模型去噪時間步,5 步生成保留 50 步品質的 89% 至 94%

OYS 不修改或蒸餾模型,而以貝葉斯最佳化為每個模型及任務尋找低步數去噪排程。研究在六款文字生成圖像模型及修補任務上報告改善,但搜尋成本需由大量預生成樣本攤銷。

Pebau.grandauer · CC BY-SA 4.0 · Image source
zh-Hant

擴散模型的推論成本通常以去噪網路前向運算次數計算;工程實作常直接縮短預設時間步,卻未必在低步數下保留最佳品質。康乃爾大學等研究者提出 Optimize Your Sampling(OYS),把時間步、guidance strength 等取樣參數視為黑箱,直接以貝葉斯最佳化搜尋能提高目標指標的設定。它不需反向傳播穿過完整取樣鏈,也不要求評分函數可微,因此可最佳化 HPS、LPIPS、PSNR 或特定任務的非微分評分。

這與 Align Your Steps(AYS)最佳化擴散 SDE 離散化 KL 上界的做法不同。OYS 每輪實際生成一批影像,再由 surrogate model 與 acquisition function 選擇下一組候選時間步;代價較高,但最佳化的是最後真正使用的品質指標。這筆搜尋成本只在每個模型與任務調校時支付,之後可由大量線上推論攤銷。

在 COCO Captions 的五步測試中,DeepFloyd、Stable Diffusion 1.5 與 SDXL 的 OYS HPS 分別為 0.252、0.238、0.245;相同步數的預設排程分別為 0.215、0.230、0.229。SDXL 的 OYS 影像相對預設排程取得 70.70% HPS 勝率。對原本即為少步生成而蒸餾的 SDXL-Turbo,三步 OYS 仍由 0.287 提升至 0.298。FLUX.1-dev 與 Qwen Image 的五步勝率則分別為 82.69% 與 77.19%。58 人參與的 SDXL 實驗亦偏好 OYS 的保真度與文字對齊。

研究將五步排程概括為保留五十步品質的 89% 至 94%,意味成熟模型可在不重訓權重下減少約十倍網路評估。不過這不是十倍端到端服務加速:文字編碼、解碼、批次調度及資料傳輸仍有固定成本。最佳排程也高度依賴模型、提示分布、sampler 與評分指標;例如 FLUX.1-dev 的調校需生成 5,376 張影像。部署方下一步應觀察排程能否跨 LoRA、量化版本與實際中文提示泛化,以及作者是否釋出可重現的搜尋程式與排程檔。

來源

  1. Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization
  2. Diffusers Scheduler 說明與 Align Your Steps 排程範例
  3. Align Your Steps: Optimizing Sampling Schedules in Diffusion Models