返回首頁

生成模型/推論

UGC 依資料依賴配置遮罩擴散步數,理論上可取得近似 oracle 的 KL 保證

新研究用「解遮罩成長複雜度」描述離散擴散在不同揭露階段的資訊難度,據此把計算集中到高曲率區段。方法可由樣本估計排程並給出高機率 KL 證書,但尚未在大型語言或影像模型上驗證。

Sgt. Michael Blalack · Public domain · Image source
zh-Hant

遮罩擴散模型從全遮罩序列出發,反覆預測並揭露離散位置;實務上通常預先選定均勻、線性或 cosine 類排程。然而不同資料分布的依賴結構,可能在揭露初期、中段或末段才突然顯現,固定排程因而把相同運算量花在難度不同的區域。MIT 的新研究提出 unmasking growth complexity(UGC),以揭露路徑上的加權資訊曲率,直接界定每一段造成的 KL 離散化誤差。

作者把時間改寫成 log-reveal-odds,也就是 `log(t/(1-t))`;在這個座標中,UGC 密度高的區域使用較小步長,密度低處則快速跨過。由於局部 UGC 可透過耦合揭露軌跡之間的 KL 增量估計,排程不必預先知道真實資料分布。論文據此建立單區塊與多區塊程序:在假設成立時,取樣器能以高機率達到指定 KL 誤差,迭代複雜度落在知道完整 UGC 路徑之 oracle 的常數倍內。細分極限下,`∫sqrt(q(λ))dλ` 的平方決定最佳 Euler 誤差;構造例顯示,少量自適應區塊相對粗排程可得到隨維度成長、最高達漸近 `Ω̃(√d)` 的改善。

這提供了一條把「noise schedule 調參」改成資料驅動資源配置的理論路線,適用範圍也不只文字,還包括離散影像、影片與蛋白質生成。但目前成果主要是定理與合成分布例子,沒有大型 MDLM 的品質、延遲或估計成本測試。最強證書還假設可取得 Bayes denoiser及 KL 增量的矩控制;換成學習式 denoiser 會多出近似誤差,而且最優性只針對 frozen-posterior Euler 類程序。下一步要看 UGC 估計開銷能否低於省下的 denoising pass,以及它在 MDLM 等公開實作上是否勝過現有 confidence 或 cosine 排程。

來源

  1. The data geometry of masking diffusion: Certified-optimal schedules via unmasking growth complexity
  2. Simple and Effective Masked Diffusion Language Models(MDLM)實作