返回首頁

機器人與世界模型

GlanceWAM 將視覺預想移出控制關鍵路徑,動作解碼降至每段 48 毫秒

GlanceWAM 每約三秒在背景生成一次未來影像的潛在表示,供多個 0.8 秒動作段重複使用。論文在 RoboCasa 報告 72.2% 成功率,但目前證據仍集中於模擬環境及作者自行量測。

Templariocristiano · CC BY-SA 4.0 · Image source
zh-Hant

研究團隊於 8 月 25 日發布 GlanceWAM,嘗試解決世界—動作模型的延遲矛盾:若每個控制週期都用影片擴散模型生成未來畫面,取樣會阻塞機器人;若完全移除測試時預想,又會失去明確的視覺子目標。新方法在同一個 1.3B 參數 SkyReels-V2-DF 影片 DiT 內拆開兩個時鐘,背景提議器約每三秒預測一個未來狀態,動作頭則每 0.8 秒產生包含 16 個控制步驟的 action chunk。

關鍵是預想結果不解碼成 RGB,而是留在影片 VAE 的潛在空間,直接作為後續動作頭的條件。模型使用三類 prefix-LM 注意力遮罩,避免乾淨的前瞻 token 污染觀測與影片生成表示;訓練時再從整個前瞻區間隨機抽取時間偏移,並把剩餘偏移量顯式送入動作頭,使同一份前瞻表示逐漸過時時,政策仍能調整。作者亦以 10% 機率丟棄前瞻 token,降低預想缺失或失真的脆弱性。

論文在 RoboCasa 24 項廚房任務報告 72.2% 成功率,高於同步 Cosmos Policy 的 67.1%及無測試時預想版本的 64.4%;LIBERO 成績為 99.0%。單張 A100 上的動作解碼為每段 48 毫秒,作者稱較同步基線快 24 倍。程式、資料與檢查點已以 MIT 授權公開,重現包約 21GB;儲存庫也提醒 RoboCasa 未固定政策隨機種子,重跑波動約 ±0.02。

48 毫秒只代表動作關鍵路徑,背景擴散仍消耗算力,部署可能需要並行 worker 或額外 GPU。評測全部來自模擬器,尚未證明網路延遲、感測雜訊與突發環境變化下的實機安全性。下一步應比較包含背景提議器在內的總功耗與硬件需求,並測試前瞻嚴重失準時能否及時回退。

來源

  1. GlanceWAM: Sparse Test-Time Imagination for World-Action Models
  2. GlanceWAM source code and reproduction guide
  3. GlanceWAM checkpoints and datasets