返回首頁

機器人與世界模型

ModAR 先預測軌跡、語意與深度再決定動作,降低世界—行動模型對 RGB 的依賴

CMU 的 ModAR 以共享擴散 Transformer 依序去噪多種未來表徵,再生成機器人動作。小規模實驗顯示,結構化表徵比額外預測 RGB 更有用,但程式碼尚未公開,真實世界證據也只有三項雙臂任務。

zh-Hant

現有世界—行動模型通常同時預測未來 RGB 畫面與機器人動作,希望從沒有動作標註的影片取得額外監督。CMU 團隊提出的 ModAR 改變了生成順序:模型先預測代表運動的 point tracks,再依序產生 DINO 語意特徵與深度,最後才生成動作;每一階段都能看到先前已完成去噪的模態。RGB 可以加入序列,但消融實驗顯示它沒有帶來一致增益。

架構核心是一個共享 diffusion transformer,搭配跨模態共用區塊、各模態專屬 expert 與輸出 head。機器人狀態和任務 embedding 透過 adaLN 注入每一層。訓練時,帶動作的示範同時監督未來表徵與動作;一般人類影片等 actionless 資料則只計算觀測預測損失。研究也發現,訓練時必須向已生成的上下文加入雜訊,否則自回歸誤差會在後續模態放大;把順序倒成 RGB、深度、DINO、軌跡同樣會降低表現。

在六項 RoboTwin 任務中,所有方法每項只有 50 筆帶動作示範,再加入移除動作標籤的資料。ModAR 在各資料量都取得最高平均成功率。以 250 筆總示範比較時,30.1M 參數的 ModAR 為 75%,由 6B 影片模型初始化的 Flex-π 為 72%;團隊估算前者參數少約 200 倍、訓練 FLOPs 少約 20 倍。真實雙臂測試則涵蓋疊杯、摺毛巾及放入抽屜,加入 200 筆同分布與 1,000 筆跨分布人類影片後,平均成功率由 70.0% 升至 83.3%。

這項結果提示 physical AI 未必需要把昂貴的像素重建當成主要世界模型目標,運動、語意和幾何可能是更直接的控制介面。但 75% 對 72% 是小差距,Flex-π 的預訓練成本比較也未涵蓋不同模型的既有訓練價值。專案頁目前標示程式碼「即將推出」;在權重、資料處理及重現腳本公開前,外界仍無法驗證計算量估算、取樣延遲或跨機器人泛化。

來源

  1. Modality-Autoregressive World-Action Models
  2. ModAR project page