世界模型與生成影片
ReWorld、姿勢インデックス付きランドマークバンクでKV予算を固定し、インタラクティブ世界モデルが遠くまで移動しても元の景観へ帰還可能に
ReWorldは、短期的な動作制御と長期的なシーン記憶に異なる注意範囲を割り当て、固定容量のランドマークバンクに履歴を保存する。著者らは704×1280のリアルタイムストリーミングと64秒間の帰還軌跡を実演したが、現時点で公開されているのは論文とデモページのみで、重みやコードは未公開だ。

香港科技大学(広州)とAlibabaの研究者らは、インタラクティブ世界モデルが抱える構造的な矛盾に対処するReWorldを提案した。キーボード入力やカメラ操作へ正確に応答するには直近のフレームへ注意を集中させる必要がある一方、はるか以前に訪れた場所を記憶するには履歴全体を保持しなければならない。スライディングウィンドウだけを使うと古いシーンはすぐに追い出され、完全なKV cacheを保持すると、移動を続けるにつれてVRAM使用量が増加する。
ReWorldは学習時、headごとに長さの異なるattention windowを混在させる。大半のheadは直近の情報だけを参照し、一部のheadのみが長期履歴へアクセスできる。ランダムなhead routingにより、制御能力や記憶能力が特定のheadへ固定的に依存することを防ぎ、履歴chunkをランダムに破棄することで、疎な記憶を学習分布の一部として組み込む。推論時には、固定サイズのKV cacheと姿勢インデックス付きlandmark bankを併用する。カメラが十分な距離を移動した場合にのみランドマークを書き込み、次の映像区間を生成する際には現在の姿勢に基づいて近傍のビューを取得するため、記憶コストは総移動距離に比例して線形に増加しない。
データパイプラインでは、Unrealによるレンダリング、ゲーム内探索、実写映像など8種類のデータソースを同一の物理スケールへ揃え、同じ制御入力が同じ移動距離を表すようにしている。また、回文的な往復軌跡によって、「その場を離れた後に戻る」動作に特化した教師信号を与える。さらに、LoRA adapterに限定したdistribution matching distillationによって拡散サンプリングを4ステップまで削減し、同一のbackboneで高画質なマルチステップモードと704×1280のリアルタイムストリーミングモードを切り替えられる。
著者らによると、ReWorldは最近の6システムとの比較で回転誤差11.95度を達成し、カメラ動作の一貫性でも最高評価を得たという。固定された12-chunk cacheを用いた64秒・384 latentの往復テストでも、出発地点を再構成できた。ただし、映像と評価結果はいずれも研究チーム自身が提供したもので、Webサイトでは重み、学習データ、実行可能なコードが公開されていない。エンジニアリング上の判断には、実測フレームレート、ハードウェアとVRAMの構成、landmark bank容量のablation、および自由探索、動的オブジェクト、累積する姿勢誤差の下での長時間安定性に関する検証を待つべきだ。