返回首頁

機器人與視覺語言動作模型

FabriMAE 以視覺注意力熵判斷機器人動作可靠度,十分支選擇令成功率升至 86.8%

FabriMAE 從 VLA 模型內部的視覺注意力熵產生可靠度分數,不需另訓練驗證器或重複執行機器人軌跡。PI0.5 在 LIBERO-Plus 的成功率增加 1.1 個百分點,但目前證據仍限於模擬環境,論文連結的程式庫亦尚未公開存取。

zh-Hant

視覺語言動作模型(VLA)可把攝影機畫面與文字指令直接轉成機器人動作,但部署系統仍缺少一個關鍵能力:在真正執行前判斷自己的動作是否可靠。傳統方法通常觀察輸出 token 機率、重複採樣的一致性,或另行訓練失敗偵測器;這些做法難以同時適用於 OpenVLA 的離散動作 token、OpenVLA-OFT 的連續輸出頭,以及 PI 系列的 flow-matching 動作生成。

FabriMAE 提出的 Markov Attention Entropy(MAE)改讀模型內部訊號。作者把 VLA 的動作生成描述為條件式生成 Markov chain,追蹤視覺、語言與狀態條件下的潛在動作表示,再由視覺注意力分布的熵建立可靠度分數。它不判讀機器人與環境的物理狀態轉移,而是衡量模型內部生成鏈;因此不需要外部裁判、額外模型前向運算或已標註的失敗資料。

團隊另外建立 LIBERO-Reflect,包含 2,000 條標準及 2,000 條高難度模擬軌跡,並以實際 simulator success flag 作為標籤。在 OpenVLA、OpenVLA-OFT 與 QwenPI-Flow 上,MAE 對成功/失敗軌跡的 AUPR、AUROC 與 FPR@95 排序普遍優於隨機、輸出統計及其他黑箱或白箱基線。這項跨架構結果值得注意,因為連續 flow policy 根本沒有可直接比較的自回歸動作-token logits。

FabriMAE 進一步把分數用於 PI0.5 的測試時選擇:十個候選共享前 70% 的 refinement 軌跡,之後加入 0.15 尺度雜訊分支,完成後選擇 MAE 分數最佳的動作塊。LIBERO-Plus 整體成功率由 85.7% 升至 86.8%,總 episode 時間增加 7.2%,每個環境步驟增加 8.94%。改善幅度不大,且 Robot 與 Noise 子項沒有提升;更重要的是,模擬器中的注意力熵能否校準真實機器人的碰撞、遮擋與感測器漂移仍未證實。論文所列 GitHub 連結目前回傳 404,外界尚無法核對 benchmark 建構、hook 位置與計時方法,應把結果視為待重現的研究訊號。

來源

  1. FabriMAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy
  2. Lifelong-Robot-Learning/LIBERO