返回首頁

世界模型與電腦視覺

World Labs Atlas 以共享空間上下文統合影片生成與 3D 重建

Atlas 把文字、影像、相機姿態與深度資料放進同一自回歸擴散架構,可生成受控鏡頭並輸出點雲或 3D Gaussian splat。廠商評測顯示稀疏視角重建優於專用模型,但尚無論文、權重或物理模擬驗證,現階段僅限早期存取。

Ordercrazy · CC0 · Image source
zh-Hant

World Labs 公布 Atlas,一個從零預訓練的多模態自回歸擴散 Transformer。它將文字、影像、相機姿態與 3D 深度圖組成共享的「空間上下文」,影片則視為影像序列;模型依序生成下一個元素,而不是只在文字提示中猜測攝影機如何移動。這使鏡頭位置與方向成為原生條件,也把受控影片生成和場景重建放進同一架構。

Atlas 同時借用兩類推論技術:自回歸部分可望使用 KV cache、快取感知路由與分離式服務,潛在擴散部分則可採蒸餾、classifier-free guidance、噪音排程及 VAE 改進。輸出不只包含 2D 畫面;模型能估計逐幀深度,產生點雲,再補全未觀測區域並轉成可於裝置端渲染的 3D Gaussian splat。輸入影像愈少,結果中的生成性推測愈多;增加觀測視角則可逐步用真實資料約束幾何。

World Labs 表示,Atlas 用兩三張影像即可完成可用重建,也能接收逾百張影像。其自行重跑的七項稀疏視角重建評測中,平均 AbsRel 誤差為 25.3×10⁻³,低於 Pi3X 的 28.7×10⁻³及其他公開基線。第三方評審在鏡頭控制生成比較中也多數偏好 Atlas,但測試並非完全對稱:Atlas取得原生相機軌跡,其他影片模型只收到描述運鏡的文字提示,因此結果較能證明介面與模型共同帶來的控制優勢,不能直接視為整體畫質排名。

這項架構對 VFX、遊戲資產、數位分身及機器人 real-to-sim 流程具有潛力,因為同一空間狀態可服務生成與顯式幾何輸出。然而發布內容沒有技術論文、訓練資料、參數量、延遲、價格或可重現程式碼;所謂「模擬」亦尚未以物體持久性、碰撞、因果或長時間物理一致性基準證實。Atlas目前只向少數合作夥伴開放,下一個關鍵訊號將是獨立重建評測、動態場景失敗率,以及能否真正改善機器人策略訓練。

來源

  1. Atlas: A World Model for Spatial Intelligence
  2. World Labs unveils Atlas, a single AI model that generates, reconstructs, and simulates 3D worlds from just a few photos
  3. World Labs' Atlas Merges Video and 3D Generation, But Robot Simulation Remains Unproven