ホームへ戻る

生成式影音與 3D

StateFlow、ショットごとの再生成を永続的な3D状態に置き換え、動画プリビジュアライゼーションのユーザー評価で4.5/5を獲得

StateFlowは、オブジェクトのジオメトリ、姿勢、セマンティック状態、カメラを編集可能な3D世界として保存し、動画モデルには視覚的な仕上げを担わせる。30人による実験では動画プリビジュアライゼーションの総合評価が4.5/5に達したが、システムは複数のクローズドモデルに依存しており、コードもまだ公開されていない。

Brocken Inaglory · CC BY-SA 3.0 · Image source
zh-Hant

北京交通大学、北京智源人工智能研究院などの研究チームが、テキスト動画生成を繰り返し編集する際に起こりがちなオブジェクトのドリフト、空間関係の変化、カメラ制御の破綻を修正するため、StateFlowを提案した。このシステムは各ショットを独立した生成タスクとして扱わず、オブジェクト単位の永続的な世界状態を維持する。各オブジェクトには、ジオメトリ、3D位置と姿勢に加え、外観やイベント状態などのセマンティック属性が含まれる。その後、スタイルの変更、オブジェクトの移動、シーンの破壊を行う際には、影響を受ける状態レコードだけを更新する。

構築段階では、まず正面図と鳥瞰図を生成する。前者はオブジェクトの外観を提供し、後者は全体レイアウトを制約する。2枚の画像でオブジェクトの数や位置が食い違う場合、VLMがどれをハルシネーションと見なし、どれを残すべきか判断したうえで、衝突、境界、セマンティック事前分布に基づいて3Dバウンディングボックスを調整する。その後、各オブジェクトの画像をHunyuan3Dに渡してアセットへ変換する。カメラプランニングには「提案—レンダリング—修正」のループを採用する。まずVLMが演出意図に沿って軌道を生成し、低コストのレンダラーがオクルージョン、フレーミング、衝突、動きの問題を実際に検査する。続いて、距離、アングル、注視点、視野角を局所的に修正する。

著者らはGemini 3.1、Nano Banana 2、Hunyuan3D、Seedance 2を組み合わせて実験システムを構築した。3Dシーンの比較では、StateFlowのCLIP-Iは0.788で、SynCityの0.689を上回った。CLIP-Tも30.214で22.880を上回ったが、HPS V2では逆にSynCityが優位だった。30人の参加者が各設定につき12件のプロンプトを評価した結果、StateFlowはシーンと最終動画の双方で総合平均4.5/5を獲得した。動画ベースラインで最も高かったのはSeedance 2の3.6だった。

ただし、この結果を汎用世界モデルのブレークスルーと見なすことはできない。テストにはジオメトリの基準となる実世界の3Dシーンがなく、自動評価にも同じGemini 3.1が使用されているうえ、プロジェクトページのコードへのリンクも依然として「soon」と表示されている。完全な処理には数分を要し、複数のサードパーティーモデルに依存する。エンジニアリング面でコード公開後に最も注目すべき点は、状態フォーマットを異なる生成器間で再生できるか、そしてコスト、失敗率、長いシーケンスの編集においても一貫性を維持できるかどうかだ。

出典

  1. StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization
  2. StateFlow project page