返回首頁

生成模型推論系統

GCache 依全程誤差配置擴散快取,Wan 2.1 同為 2.17 倍加速時 LPIPS 降至 0.0316

GCache 不再只比較相鄰去噪步驟的局部差異,而是估算快取誤差對最終影像或影片的累積影響。它以動態規劃選擇快取刷新點,再用 Bayesian optimization 讓理論權重對齊實際生成品質。

@cfcunofficial (Chelsea Debs) London from London, UK · CC BY-SA 2.0 · Image source
zh-Hant

擴散 Transformer 的相鄰去噪步驟含有大量重複中間特徵,因此 TeaCache、ERTACache 等方法會重用 residual,跳過部分完整模型運算。問題是局部 L1 差異與最終品質並不總是同步:某一步的 residual 看似變化很大,誤差可能很快消散;較早注入的小誤差則可能沿 ODE 軌跡被放大。只按當前相似度決定是否刷新,容易把運算預算放錯位置。

GCache 先推導單次與多次快取重用的全局誤差上界,把每個局部 residual 誤差乘上與時間位置相關的傳播權重。由於 Lipschitz 假設產生的最壞情況上界過度保守,研究者再以 Bernstein polynomial 參數化傳播指數:內層在固定 $K$ 次完整刷新預算下,把選點轉成最短路徑問題,以 $O(KN^2)$ 動態規劃求解;外層則以 Gaussian-process Bayesian optimization 搜尋係數,使選出的策略直接降低 LPIPS 等實測損失。

團隊在單張 NVIDIA A800 80GB 上測試 Open-Sora 1.2、CogVideoX-2B、Wan 2.1-1.3B 與 FLUX.1-dev,影片使用 VBench 的 946 個提示,影像使用 COCO 30K 提示。Wan 2.1 的 81 幀、480p、50 步設定原需 199 秒;GCache-slow 為 91.6 秒,即 2.17 倍加速。在相同速度下,其 LPIPS 為 0.0316,ERTACache 為 0.1095;fast 策略則以 66.1 秒達 3.01 倍加速,LPIPS 仍為 0.0828。FLUX 在相同 2.87 倍加速下,GCache 的 LPIPS 亦由 ERTACache 的 0.2658 降至 0.1825。

方法不需重新訓練生成模型,也不用額外誤差修正網路,適合離線為固定模型與 scheduler 搜尋部署策略。但目前刷新預算固定,局部誤差矩陣來自完整軌跡預計算,極端運動或離群輸入可能令實際軌跡偏離代理值;測速亦只來自 A800。論文尚未連結公開程式,因此工程師仍需等待跨 GPU 重現、策略搜尋成本,以及不同 solver、量化和動態輸入下的結果。

來源

  1. From Local Mismatch to Global Impact: Optimizing Cache Reuse Policy for Efficient Diffusion
  2. Wan 2.1 official repository