AI 推論系統
GCache 依全程誤差影響配置擴散快取,Wan2.1 同速下 LPIPS 降至 0.0316
GCache 不再以相鄰去噪步驟的局部相似度決定是否重算,而是搜尋對最終畫質影響最低的快取重用序列。它在 Wan2.1 維持 2.17 倍加速時大幅降低偏差,但策略搜尋需要多張 H100,實作亦尚未公開。

8 月 13 日提交的 GCache 研究,把擴散模型的快取問題由逐步閾值判斷改寫成全局排程。TeaCache、ERTACache 等方法通常比較相鄰去噪步驟的特徵或殘差,再決定能否沿用先前計算;作者指出,相同的局部誤差在不同時間點會以不同幅度傳播至最終影像,因此「眼前最相似」不一定是最安全的重用位置。
GCache 先推導誤差沿去噪軌跡累積的上界,再以 Bernstein 形式學習傳播權重。內層動態規劃在固定重算預算 K 下選出快取刷新點,外層則以貝葉斯最佳化,讓加權誤差代理與實際生成品質損失對齊。策略一旦算好,推論階段只需按固定時間表重用殘差,不會加入額外的誤差估計網路。
研究涵蓋 Open-Sora 1.2、CogVideoX-2B、Wan2.1-1.3B 與 FLUX.1-dev,主要延遲測試使用單張 A800 80GB,並以五個隨機種子平均。在 Wan2.1 的 81 幀、480p 設定中,GCache 以 91.6 秒完成生成,相對完整 50 步推論加速 2.17 倍;與相同加速率的 ERTACache 相比,LPIPS 由 0.1095 降至 0.0316。較激進設定可達 3.01 倍加速,但 LPIPS 回升至 0.0828。FLUX.1-dev 在 2.87 倍加速時則錄得 0.1825 LPIPS。
這不是免費的通用 runtime 最佳化:每個骨幹及預算均須先搜尋策略,Wan2.1 使用八張 H100 約 13.5 至 17.5 小時。方法亦採固定刷新預算及預先計算的誤差代理,未依個別提示或高動態軌跡即時調整。程式與策略檔尚未公開,工程價值仍取決於能否在不同排程器、量化版本及新解析度上重現。