返回首頁

機器人/世界模型

GeniWorld 將機器人動作渲染成視覺條件,合成資料使實機成功率升至 69.0%

GeniWorld 先以 URDF 將關節動作轉為像素對齊的機器人運動,再讓因果 DiT 預測環境如何回應。作者在四項實機任務報告整體成功率由 40.8% 升至 69.0%,但尚未公開程式與模型權重。

Army; part of the collection of the Office of War Information · Public domain · Image source
zh-Hant

多數機器人世界模型直接把關節角度或末端執行器座標輸入影片生成器,但低維數值缺乏像素層級的空間對應,也容易把機身運動、物體變化與背景外觀混在同一條條件路徑。8 月 6 日公布的 GeniWorld 改用機器人的 URDF 與正向運動學,把未來動作渲染成只包含機身的密集視覺序列,再經 3D VAE 編碼,與影片 latent 沿通道拼接後輸入因果 DiT,以 flow matching 預測下一段觀察。

此設計把 embodiment kinematics 與場景動態拆開,同時保留預訓練影片模型的時空先驗。推論時,模型以自回歸方式把生成畫面送回控制迴圈,並用 KV cache 保存歷史。作者在 RoboTwin2.0 的 50 項任務上,以 2,250 條乾淨場景軌跡訓練,再對 250 條隨機化場景零樣本測試;視覺動作版本的 FVD 為 20.15,低於 Ctrl-World 的 35.85。把 flow-matching 取樣由 50 步降至 5 步,作者稱速度約提高十倍、FVD 僅惡化約 2%。

實機部分涵蓋移碗、摺毛巾、放杯與開抽屜。每項任務先收集 25 條真人示範,再加入空間隨機化與多樣場景的合成軌跡;整體成功率由只用真實資料的 40.8% 升至 69.0%。五步取樣在單張 NVIDIA H20 上約達 8 Hz,足以支援互動式遙控,但距離高頻實體控制仍有差距。更重要的限制是,現有證據只涵蓋四項雙臂桌面任務,成功判定部分依賴人工與 VLM;專案頁目前也只展示方法與結果,程式、權重及資料尚未提供,因此泛化與實機相關性仍需獨立驗證。

來源

  1. GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions
  2. GeniWorld Project Page