AI 推論系統
GCache、全過程の誤差影響に基づき拡散キャッシュを配置、Wan2.1で同等速度時のLPIPSを0.0316に低減
GCacheは、隣接するデノイズステップ間の局所的な類似度で再計算の要否を決めるのではなく、最終的な画質への影響が最小となるキャッシュ再利用シーケンスを探索する。Wan2.1で2.17倍の高速化を維持しながら偏差を大幅に抑えた一方、方策探索には複数のH100が必要で、実装もまだ公開されていない。

8月13日に提出されたGCacheの研究は、拡散モデルのキャッシュ問題を、ステップごとのしきい値判定からグローバルなスケジューリングへと再定式化した。TeaCacheやERTACacheなどの手法は通常、隣接するデノイズステップの特徴量や残差を比較し、以前の計算結果を再利用できるか判断する。著者らは、同じ局所誤差でも、発生する時点によって最終画像へ伝播する大きさが異なるため、「現時点で最も似ている」ことが必ずしも最も安全な再利用箇所を意味しないと指摘する。
GCacheはまず、デノイズ軌跡に沿って累積する誤差の上界を導出し、次にBernstein形式で伝播重みを学習する。内側の動的計画法では、再計算予算Kを固定した条件でキャッシュの更新点を選択する。外側ではベイズ最適化を用い、重み付き誤差の代理指標を実際の生成品質の低下と整合させる。方策を一度算出すれば、推論時には固定スケジュールに従って残差を再利用するだけでよく、追加の誤差推定ネットワークは導入されない。
研究はOpen-Sora 1.2、CogVideoX-2B、Wan2.1-1.3B、FLUX.1-devを対象とし、主なレイテンシ測定にはA800 80GBを1基使用した。結果は5つのランダムシードの平均である。Wan2.1の81フレーム、480p設定では、GCacheは91.6秒で生成を完了し、完全な50ステップ推論に対して2.17倍の高速化を達成した。同じ高速化率のERTACacheと比較すると、LPIPSは0.1095から0.0316へ低下した。より積極的な設定では3.01倍まで高速化できるが、LPIPSは0.0828へ上昇する。FLUX.1-devでは、2.87倍の高速化時にLPIPS 0.1825を記録した。
これはコストなしで利用できる汎用的なruntime最適化ではない。バックボーンと予算の組み合わせごとに、あらかじめ方策を探索する必要がある。Wan2.1ではH100を8基使用し、約13.5~17.5時間を要した。また、この手法は固定の更新予算と事前計算済みの誤差代理指標を採用しており、個々のプロンプトや動きの激しい軌跡に応じたリアルタイム調整は行わない。コードと方策ファイルはまだ公開されておらず、エンジニアリング上の価値は、異なるスケジューラ、量子化バージョン、新しい解像度でも結果を再現できるかどうかに左右される。