機器人與世界模型
Faster-WAM、ロボットのアクションヘッドを1層に縮小し、制御推論レイテンシを66.5ミリ秒に短縮
Faster-WAMは、30層の動画Transformerに1層のアクションヘッドを接続し、層横断KV融合によって世界モデルの表現を取得することで、アクションブランチがバックボーン全体の深さを複製する必要をなくした。研究ではFast-WAM比で3.2倍の高速化が報告されているが、新アーキテクチャのコードと重みはまだ公開されておらず、結果も主にシミュレーションベンチマークに基づいている。

世界アクションモデル(World Action Model、WAM)は、将来の視覚的変化とロボットの動作を同時に学習する。しかし、一般的な共有バックボーンやMixture-of-Transformersの設計では、アクションモジュールが動画モデルと同じ深さになる。8月3日に提出されたFaster-WAMは、この対称性の仮定に疑問を投げかける。動画Transformerが各層ですでに十分な空間・意味・動的表現を形成しているのであれば、アクション側はそれらの表現を読み取るだけでよく、数十層分の計算を再び実行する必要はない可能性がある。
研究チームは、事前学習済み動画Transformerを表現のハブとして扱うDock of Transformer(DoT)インターフェースを提案した。Faster-WAMの動画バックボーンは30層だが、アクションヘッドはわずか1層である。このインターフェースは動画モデルの全層からkeyとvalueを収集し、融合とRoPEによる位置の再アラインメントを行ったうえでアクションヘッドに渡す。これにより、浅いヘッドでも抽象度の異なる視覚情報にアクセスできる。この仕組みは、推論時に明示的な将来動画生成を省く従来のFast-WAMの方針を補完するものだ。動画モデリングは主に学習時の表現源として機能し、オンライン制御では動作を直接生成する。
論文では、同一の制御条件下で1回の推論に66.5ミリ秒を要し、Fast-WAMの統制されたベースラインに比べて3.2倍高速だったと報告している。モデルは追加のembodied pretrainingを実施していないが、LIBEROおよびRoboTwin 2.0で競争力のある成功率を維持し、外観、物体、または命令の分布を変更したLIBERO-Plusで汎化能力を評価している。これは、WAMのレイテンシボトルネックへの対処が、量子化、蒸留、デノイジングステップ数の削減だけに限られず、モダリティブランチ自体の深さ構成も独立して最適化できるアーキテクチャパラメータであることを示している。
ただし、66.5ミリ秒という値は論文の統制環境におけるエンドツーエンドの測定値であり、実機ロボットのセンシング、通信、アクチュエーションを含む制御ループと同一視することはできない。新しいFaster-WAMについては、現時点で公開された重みや公式実装も確認されていない。既存のFast-WAMリポジトリは、前世代の学習および評価設定を理解するために利用できるにすぎない。今後注目すべき点は、層横断KV融合のメモリコスト、異なる動画バックボーンへの移植性、そして長時間の実機操作において、浅いアクションヘッドが接触制御やエラー回復能力を損なわないかどうかである。