機器人與世界模型
Faster-WAM 將機器人動作頭縮至一層,控制推論延遲降至 66.5 毫秒
Faster-WAM 把單層動作頭接到 30 層影片 Transformer,透過跨層 KV 融合取得世界模型表徵,不再讓動作分支複製完整骨幹深度。研究報告相對 Fast-WAM 加速 3.2 倍,但尚未公開新架構的程式碼與權重,結果也主要來自模擬基準。

世界動作模型(World Action Model,WAM)同時學習未來視覺變化與機器人動作,但常見的共享骨幹或 Mixture-of-Transformers 設計,會讓動作模組跟影片模型一樣深。8 月 3 日提交的 Faster-WAM 質疑這項對稱假設:若影片 Transformer 已在各層形成足夠的空間、語義與動態表徵,動作端或許只需讀取這些表徵,而不必再次執行數十層計算。
團隊提出 Dock of Transformer(DoT)介面,把預訓練影片 Transformer 視為表徵中樞。Faster-WAM 的影片骨幹共有 30 層,動作頭卻只有一層;介面蒐集所有影片層的 key、value,經過融合及 RoPE 位置重新對齊後交給動作頭,使淺層頭仍可存取不同抽象程度的視覺資訊。這與先前 Fast-WAM 在推論時取消顯式未來影片生成的方向互補:影片建模主要作為訓練表徵來源,線上控制則直接產生動作。
論文在相同控制條件下報告每次推論需 66.5 毫秒,較 Fast-WAM 的受控基線快 3.2 倍。模型沒有額外進行 embodied pretraining,在 LIBERO、RoboTwin 2.0 上維持具競爭力的成功率,並在改變外觀、物體或指令分布的 LIBERO-Plus 測試泛化能力。這表示 WAM 的延遲瓶頸未必只能靠量化、蒸餾或減少去噪步數處理,模態分支本身的深度配置也是可獨立最佳化的架構參數。
但 66.5 毫秒是論文受控環境的端到端數字,尚不能等同實體機器人的感測、通訊與致動迴圈。新 Faster-WAM 目前也未找到公開權重或官方實作;現有 Fast-WAM 程式庫只能協助理解前代訓練及評估設定。值得追蹤的是跨層 KV 融合的記憶體成本、不同影片骨幹上的可移植性,以及在長時間實體操作中,淺動作頭是否會犧牲接觸控制與錯誤恢復能力。