返回首頁

多模態與世界模型

Puffin-World 將重力、深度與影像納入同一世界模型,直接生成多視角 RGB-D 與點雲

Puffin-World 以九通道 Omni-Camera 條件統一絕對物理方向與相對鏡頭運動,並在同一架構中完成理解、生成及三維重建。程式、權重與 Puffin-16M 資料已公開,但物理狀態目前主要限於靜態場景的重力和緯度。

Giles Laurent · CC BY-SA 4.0 · Image source
zh-Hant

南洋理工大學、密西根大學、北京交通大學與 ACE Robotics 團隊公開 Puffin-World 論文。它沒有只把世界表示為連續 RGB 畫面,而是顯式聯合建模三種狀態:以重力場與緯度圖描述物理方向、以深度圖描述幾何、再以影像描述外觀。輸入單張影像或文字、目標鏡頭軌跡後,模型可共同生成多視角 RGB-D,並把結果整合成同一座標尺度下的彩色點雲,不需額外離線深度估計或重建模組。

架構由幾何對齊視覺編碼器、LLM、擴散模型及輕量連接器組成。關鍵的 Omni-Camera 是每像素九通道條件:二維向上向量與緯度角構成三通道絕對場,另以光線原點和方向構成六通道相對幾何。前者提供「真實世界的上方」與地平線錨點,後者表示鏡頭內參、平移與旋轉。模型再把參考畫面的重力方向依相對旋轉傳播到後續視角,降低長軌跡或大幅翻滾時的地平線漂移。

訓練資料 Puffin-16M 包含 1,500 萬組視覺—語言—鏡頭資料與 100 萬條軌跡,涵蓋俯仰、翻滾、完整 360 度偏航及複合動作;團隊也為 28 個公開資料集約 4,450 萬張影像產生鏡頭標註。作者報告模型在四項單目鏡頭估計資料集取得全部 12 個中位誤差指標最佳結果,並在 RealEstate10K 達 PSNR 17.22、LPIPS 0.318。然而這些比較主要由作者完成,部分新基準亦由同一團隊建立。更重要的是,所謂「物理」目前只涵蓋重力、緯度與靜態幾何,尚未處理碰撞、材質、物體動力學或長時間因果演化。後續價值將取決於獨立重現、動態場景評測,以及限制商業使用可能性的 NTU S-Lab License 1.0 條款。

來源

  1. Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
  2. Puffin-World technical article
  3. Puffin Series repository