ホームへ戻る

多模態與世界模型

Puffin-World、重力・深度・画像を単一の世界モデルに統合し、マルチビューRGB-Dと点群を直接生成

Puffin-Worldは、9チャンネルのOmni-Camera条件によって絶対的な物理方向と相対的なカメラ運動を統一し、単一のアーキテクチャで理解、生成、3D再構成を実現する。コード、重み、Puffin-16Mデータセットは公開済みだが、現時点で扱う物理状態は主に静的シーンの重力と緯度に限られる。

Giles Laurent · CC BY-SA 4.0 · Image source
zh-Hant

南洋理工大学、ミシガン大学、北京交通大学、ACE Roboticsのチームが、Puffin-Worldの論文を公開した。同モデルは世界を連続するRGBフレームとして表現するだけでなく、重力場と緯度マップで物理方向を、深度マップで幾何構造を、画像で外観を表すという3種類の状態を明示的に共同モデリングする。単一の画像またはテキストと、目標カメラ軌道を入力すると、マルチビューRGB-Dを共同生成し、その結果を同一の座標系とスケールを持つカラー点群へ統合できる。追加のオフライン深度推定や再構成モジュールは不要だ。

アーキテクチャは、幾何学的にアラインされたビジュアルエンコーダー、LLM、拡散モデル、軽量コネクターで構成される。中核となるOmni-Cameraは、ピクセルごとに9チャンネルの条件を与える。2次元の上向きベクトルと緯度角が3チャンネルの絶対場を構成し、さらにレイの原点と方向が6チャンネルの相対幾何を構成する。前者は「現実世界における上方向」と地平線のアンカーを提供し、後者はカメラの内部パラメーター、並進、回転を表現する。さらにモデルは、参照フレームの重力方向を相対回転に基づいて後続の視点へ伝播させ、長い軌道や大きなロール回転における地平線のドリフトを抑える。

学習データセットのPuffin-16Mには、1,500万組の視覚・言語・カメラデータと100万本の軌道が含まれ、ピッチ、ロール、完全な360度ヨー、複合動作を網羅する。チームはまた、28件の公開データセットに含まれる約4,450万枚の画像に対してカメラアノテーションを生成した。著者らの報告によると、同モデルは4つの単眼カメラ推定データセットにおける全12種類の誤差中央値指標で最高成績を達成し、RealEstate10KではPSNR 17.22、LPIPS 0.318を記録した。ただし、これらの比較は主に著者自身が実施しており、一部の新しいベンチマークも同じチームによって構築されている。さらに重要なのは、現時点で「物理」と呼ばれているものが重力、緯度、静的な幾何構造のみに限定され、衝突、材質、物体ダイナミクス、長期的な因果的変化はまだ扱っていない点だ。今後の価値は、独立した再現実験、動的シーンでの評価、そして商用利用を制限する可能性があるNTU S-Lab License 1.0の条項に左右されるだろう。

出典

  1. Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
  2. Puffin-World technical article
  3. Puffin Series repository