ホームへ戻る

世界模型與生成式影片

Code World Model、実行可能なプログラムで世界状態を保持し、動画モデルでレンダリング

新たなフレームワークでは、coding agentがルールと長期的な帰結を管理し、状態を深度およびセマンティックproxy videoへコンパイルして、MiniMax-H3による映像生成を制約する。プロトタイプでは5組の制御されたシーンが示されたが、定量ベンチマーク、アブレーション実験、リアルタイム生成結果は提示されていない。

President (1969-1974 : Nixon). White House Gift Unit. 1/20/1969-8/9/1974 · Public domain · Image source
zh-Hant

西湖大学と南洋理工大学の研究者らは、[Code World Model](https://arxiv.org/abs/2608.25927)を提案した。「世界がどのように変化するか」と「世界がどのように見えるか」を、2つの計算経路に分離する。coding agentはイベントの解釈とプログラムの作成・修正を担い、実行可能なプログラムは各tickで位置、関係、ルール、イベント履歴を更新する。短い動画のみから次のフレームを推測する手法と比べ、この状態表現では、すでに画面外へ出たキャラクターや、より長い時間が経過した後に生じる帰結も保持できる。

システムはコードを動画生成器へ直接入力せず、更新後の状態を決定論的にフレーム単位のproxy videoへコンパイルする。プロトタイプでは、固定対数深度マップとセマンティックIDマップを用いて、シーンのレイアウト、オブジェクトの位置、オクルージョン、移動経路、カメラ軌跡を表現する。テキストプロンプトは、アイデンティティ、外観、動作の意味情報を補完する。これにより動画モデルは、隠れたルールまで同時に推測する必要がなくなり、テクスチャと精緻な動きの生成に集中できる。

研究者らは視覚バックボーンとしてMiniMax-H3 Ref2VAを採用し、157本、合計約5.6時間のゲームプレイ録画から、5秒間のペアデータ9,420組を構築した。学習では全50個のTransformer blockにrank-128 LoRAを追加し、学習可能パラメータ数は約596M。8基のH800を使用して3 epoch学習した。ターゲット動画は124フレーム、解像度1344×768、24 FPSで、入力proxyは336×192まで縮小されている。これは、中間表現が意図的に粗い時空間制約だけを保持していることを示している。

[プロジェクトページ](https://buaacyw.github.io/cwm/)では、同一の世界状態を長時間維持する例、60秒ごとに視覚スタイルを切り替える例、異なるキャラクターやシーンの生成例が公開されている。論文は、モデルがオブジェクトの位置、カメラ、動きの制約に従えると主張しているが、提示された証拠は5組の定性的な事例のみであり、制御精度、動画品質、レイテンシーに関する評価や、比較アブレーションはない。また、実画像パイプラインについても、KITTI-360の幾何データからproxyを構築する方法を示すにとどまり、実際のファインチューニングにはゲームデータが使われている。したがって現時点では、リアルタイム動作が可能なオープンワールドエンジンというより、検査可能な状態表現と生成レンダリングを結ぶインターフェースのプロトタイプと見るのが適切だ。次の重要なステップは、完全なコードを公開し、長期状態に対するストレステストを導入するとともに、agentによる書き換えエラーが視覚的な結果へどのように伝播するかを定量化することである。

出典

  1. Code World Model: Coding Agent as World Brain
  2. Code World Model Project Page
  3. buaacyw/code-world-model