機器人與世界模型
CLAP 統一異構機器人的動作空間,將影片世界模型用作跨形態模擬器
CLAP 先以潛在動作從無標註影片學習物理規律,再把表徵接回機器人末端執行器座標。研究團隊已開放程式碼與多種 checkpoint,但生成影片的物理幻覺仍限制其直接參與安全關鍵控制。

新公開的 CLAP 嘗試解決機器人影片世界模型難以跨硬體共用的問題:Franka、WidowX、雙臂機器人與人形機器人的自由度、關節定義及控制介面皆不相同,而大量人類影片甚至沒有動作標註。團隊以三種表示連接這些資料,包括七維末端執行器姿態、自然語言動作,以及從相鄰影格學出的 32 維潛在動作。
訓練採兩階段課程。模型先用潛在動作吸收人類及多種機器人影片中的時空規律,再換成可直接驅動機器人的末端執行器條件繼續訓練。影片生成骨幹建於 Stable Video Diffusion,以歷史影格、機器人狀態及多視角畫面預測動作後的未來。這種安排兼顧無標註影片的規模與幾何控制訊號的精度,避免部署時仍須把抽象潛在向量翻譯成實際命令。
作者在 Open X-Embodiment、EgoDex、DROID 與 Bridge 等資料上訓練,每次實驗使用八張 H100 或 H200、約兩至三天。報告顯示,跨形態模型在 DROID 可追平同骨幹的單一形態基線;相較只從人類影片抽取動作的基線,部分 LPIPS 指標至少改善 61%。實驗也發現,末端執行器使用絕對座標較不易累積誤差,DROID 的 LPIPS 約優於相對座標 14.6%,但語言條件反而適合較緊湊的相對表示。
開放套件包含跨形態、DROID、Bridge、雙臂 YAM 與 G1 人形機器人的 checkpoint,以及回放、鍵盤控制和 policy-in-the-loop 範例。工程價值在於可先用影片模擬多組候選動作,再交給真機執行;然而評測多為作者控制的資料與約百條軌跡,論文本身也承認模型仍會產生違反物理的幻覺。下一步應觀察獨立重現、推論延遲、長期誤差與不確定性校準,而非把視覺逼真的預測直接視為可靠模擬。