返回首頁

電腦視覺

WorldSculpt 以單物體生成先驗拆解數百物體場景,但仍依賴遮罩與相機姿態

Alaya Lab 與東京大學公開 WorldSculpt,將多視角影像中的每個物體生成為可獨立編輯的完整網格,再以剛體轉換組合成場景。模型只用單物體資料微調,卻能處理 93 至 701 個物體的測試環境;不過輸入仍需可靠的實例遮罩、3D 框與相機姿態。

Brocken Inaglory · CC BY-SA 3.0 · Image source
zh-Hant

多數神經式 3D 重建方法會把房間或街景表示成單一 NeRF、3D Gaussian Splatting 或整體網格;視覺效果可以逼真,卻難以直接搬動、替換或模擬其中某一件物體。WorldSculpt 改以「逐物體生成、最後組裝」處理密集場景:輸入是帶相機姿態的 RGB 影像、逐物體 instance mask 與粗略 3D bounding box,輸出則是位於共同世界座標中的獨立 mesh 集合。

系統以 Pixal3D 的單物體生成先驗為核心。每個物體先依可見度最高的 anchor view 建立 canonical cube;各視角的裁切影像經 DINOv3 抽取特徵,再投影到同一 voxel grid。具排列不變性的 IBR 式聚合器為不同視角、不同 voxel 分配殘差權重,融合結果透過零初始化投影層與 rank 32 LoRA 注入 Pixal3D 的兩階段 DiT:第一階段預測稀疏佔用結構,第二階段生成細部形狀。完成的 canonical mesh 再以已知剛體轉換放回世界座標,因此物體之間不需要額外融合或逐物體 ICP。

值得注意的是,訓練只使用 TexVerse 的單物體資料,每次隨機取 1 至 20 個視角,沒有用完整場景共同訓練。團隊另建立 UE-MeshyScene:六個 Unreal Engine 5.8 環境共含 2,299 個物體,單一場景介於 93 至 701 個。論文稱 WorldSculpt 在所有報告指標上勝過多視角基線 ShapeR;消融實驗顯示,在 UE-MeshyScene 將簡單平均改為學習式 IBR 聚合後,Chamfer Distance L2 降低 12%,F-score 由 0.944 提高至 0.951。

但這不是「任意影片直接轉可編輯世界」的完整管線。遮罩、相機姿態和粗定位框仍由上游提供,框嚴重偏移、遮罩錯誤、低光或運動模糊都會破壞生成結果;基準的真值網格也因版權限制不能直接下載,需聯絡團隊評測。接下來應觀察真實手持影片的端到端重現、每物體推論成本,以及偵測、追蹤、定位與生成能否聯合最佳化。

來源

  1. WorldSculpt: Generating Compositional Worlds from Grounded Videos
  2. WorldSculpt 官方實作
  3. WorldSculpt 專案頁面