推論系統
DriveCache、予定車両軌跡に基づきノイズ除去キャッシュを配分し、Wan2.2 A14Bで高い忠実度を維持しながら1.97倍に高速化
DriveCacheは、生成前に既知の車両の並進と回転を利用し、さまざまな運転シーンに応じて拡散モデルの特徴量再利用をスケジューリングする。Wan2.2 A14Bでは、SeaCacheとほぼ同等の高速化を達成しつつ、PSNRが1.276 dB高かったが、コードはまだ公開されていない。

拡散ベースの運転世界モデルでは、複数のノイズ除去ステップにわたって大規模なbackboneを繰り返し実行する必要がある。既存のキャッシュ手法の多くは、固定間隔、または生成中に観測される特徴量の変化に基づいて、計算を再利用するタイミングを決めている。8月17日に提出されたDriveCacheは、代わりに計画システムから元々提供されるego trajectoryを事前に読み込み、累積並進距離と回転角から、シーンが許容できるキャッシュ誤差を推定する。静止シーンや直線走行シーンではより多くの特徴量を再利用し、旋回シーンではより保守的に動作する。
システムはまず、低運動と移動を伴う旋回という2つのanchorで完全なノイズ除去trajectoryを実行し、続いてJacobian-vector productを用いて、連続的な再利用が最終latentに与える複合的な摂動を推定する。動的計画は、誤差予算の範囲内でキャッシュの回数と位置を選択する。推論時に入力のdriftがキャリブレーション範囲を超えると、コントローラーはその再利用を中止して特徴量を更新し、未実行のステップを再計画する。モデルの重みやサンプリングステップ数は変更しないが、Wan2.2 A14Bのdual-expert境界を守る必要があり、高ノイズexpertと低ノイズexpertをまたいで特徴量を再利用することはできない。
著者らは、単一のH20、batch size 1という条件で、Wan2.2 5B、A14B、Eponaをテストした。5B構成では1.84倍の高速化と34.744 dBのPSNRを達成した。A14Bでは1.97倍と32.778 dBを達成し、同等の高速化レベルにおいてSeaCacheをそれぞれ1.884 dB、1.276 dB上回った。Eponaでは1.89倍の高速化を達成した。A14Bのキャリブレーションには約9分を要し、コントローラーによる追加レイテンシーはend-to-end時間の0.7%未満だった。
工学的な価値は、汎用的な画像キャッシュ規則だけに依存せず、制御システムの事前信号を生成器のスケジューリングに取り込んだ点にある。ただし、評価は依然として著者が選定した3種類の生成構成と単一GPU環境に限られており、PSNR、LPIPS、trajectory指標もclosed-loopの運転安全性テストの代替にはならない。論文は現時点でコードを後日公開すると述べるにとどまり、外部チームはまだ結果を完全には再現できない。