機器人與世界模型
DECOWAM 拆分機器狗底座與手臂表徵,只更新 2,595 萬參數便將動作 MSE 降低 21.7%
DECOWAM 在凍結的 60.2 億參數 FastWAM 上加入底座、手臂及相機自我運動介面,部署時只使用當前觀測預測 48 步動作。實體機器人測試的整體完成率僅略高於 FastWAM,但底座受擾穩健率由 12.7% 提高至 30.4%。

固定式機械臂的世界—動作模型通常把相機視角視為不變;當相機裝在四足底座上,畫面位移卻同時混合物體運動、手臂動作與機身移動。DECOWAM 因此沒有把 14 維全身動作塞入單一潛在表示,而是建立底座與手臂兩條表徵,利用梯度反轉降低兩者互相洩漏,並把三維底座速度直接加入影片 token,解釋相機自我運動。[論文](https://arxiv.org/abs/2608.20114)另以可看見未來畫面的教師,將「等效未來」壓縮到只讀取目前畫面與機器人狀態的學生瓶頸;部署時移除教師與未來輸入,因此仍是因果策略。系統以 [FastWAM 開源實作](https://github.com/yuantianyuan01/FastWAM)為骨幹,第二階段凍結約 60.21 億參數,只訓練 2,595 萬個 adapter、瓶頸及條件參數,約縮小 232 倍。固定的 23 段回放測試中,影格 MSE 降低 15.0%,48 步動作 MSE 降低 21.7%;代價是評估延遲增加 11.4%。更重要的 79 次實體測試中,DECOWAM 完成 46 次、成功率 58.2%,僅比 FastWAM 的 57.0%略高,但平均完成時間少 16 秒;全身協調率由 34.2%升至 44.3%,底座位移擾動下的成功率則由 12.7%升至 30.4%。資料面仍是主要限制:ARMDOG 雖包含 1,487 段、343,550 幀同步資料,56%集中在瓶子取放,回放評估更只有八項盒子任務;論文也只稱資料與轉換工具「計畫釋出」。工程師應觀察完整資料、模型權重及安全控制是否公開,以及優勢能否跨機器人形態、場景與更大規模實體試驗重現。