機器人/VLA 訓練
EXIMO 以 VLM 編排探索再蒸餾進 3B VLA,無需新增遙操作示範
Google DeepMind 讓視覺語言模型先把長流程機器人任務拆成 VLA 可執行的子目標,再用成功軌跡微調原模型並加入殘差式離策略強化學習。方法提高模擬任務的探索效率,但尚未證明能在實體機器人上取代人工示範。

Google DeepMind 提出的 [EXIMO](https://arxiv.org/abs/2608.19891) 將機器人新任務適應拆成 Explore、Imitate、Optimize 三階段,目標是在不追加遙操作資料的情況下微調大型視覺—語言—動作模型(VLA)。實驗基礎模型是 30 億參數的 Gemini Robotics On-Device(GROD),具備拾取、放置等基本技能,卻會在「把猴子愛吃的水果放進碗裡」這類需要常識或多步組合的指令失敗。
探索階段加入一個較強的 VLM 作閉環編排器。它定期查看場景影像及任務歷史,把高階目標改寫成 GROD 能直接理解的短期自然語言指令,並可隨執行狀態重新規劃。環境的真值成功偵測器只保留完成的 rollout,形成新的監督資料。
模仿階段不要求部署時繼續呼叫 VLM,而是讓 GROD 以原始高階目標為條件學習成功軌跡,把編排器的分解能力蒸餾回單一 VLA。最後,EXIMO 凍結大型 VLA 的主要動作,另以 MPO 訓練較小的殘差策略,輸出對原動作的修正量;這避開直接對擴散式動作頭做強化學習的高成本,也讓已具非零成功率的策略提供較好的探索起點。
論文在 ALOHA 模擬器以22項操作任務、每種方法1,000個 episode 比較探索與蒸餾,線上 RL 部分則彙整20項任務並使用五個隨機種子。作者報告三階段組合在成功率、達成時間及環境步數上均勝過未編排的 GROD,以及只對基礎 GROD 做更久 RL 的對照。[GROD 官方資料](https://deepmind.google/blog/gemini-robotics-on-device-brings-ai-to-local-robotic-devices/)顯示原模型本就為本地推論及快速適應設計;EXIMO 的新意在於用 VLM 自行收集並蒸餾新任務資料。不過實驗全在模擬器,依賴無雜訊的成功判定與重設機制,也尚未提供程式碼。下一步關鍵是實機樣本效率、失敗軌跡安全性,以及以 VLM 評分取代真值偵測器後會累積多少誤差。