返回首頁

電腦視覺與具身 AI

HOPE 從單眼影片預測手部壓力,OpenTouch 頂點接觸 F1 達 0.660

HOPE 將觸覺手套、平面感測器與純接觸標註統一映射到 MANO 手部網格。它能從普通 RGB 影片輸出逐頂點壓力與接觸,但公開頁面目前仍標示程式及模型「即將推出」。

George Frederic Watts and workshop · Public domain · Image source
zh-Hant

視覺模型通常只能判斷手是否碰到物體,若要估計施力大小,既有方法多依賴平面壓力墊、單張影像或特定感測器座標。HOPE 將問題改寫為手部中心的影片預測:不論物體形狀或感測器佈局,輸出都落在 MANO 手部網格的逐頂點接觸機率與法向壓力,因此同一表示可以跨資料來源訓練。

系統先把 OpenTouch 觸覺手套的 taxel、PressureVisionDB 平面讀值,以及 DexYCB、ARCTIC 的距離式接觸標註投影到共同網格。VertexFormer 把每個手部頂點視為跨幀持續存在的 token,交替執行頂點自注意力、對 DINOv3 影像 patch 的交叉注意力與時間注意力;手部姿態則來自 HaWoR 等外部重建器。壓力頭採用接觸閘門 `p̂ = ĉ ⊙ p̃`,把「沒有接觸便沒有壓力」直接寫進架構,也讓沒有力值的接觸資料能約束壓力分布。

在 OpenTouch 保留測試集上,HOPE 的 frame-level 接觸 F1 為 0.874,vertex-level F1 為 0.660;HACO 分別為 0.835 與 0.361。其逐頂點壓力 MAE 為 1.808 kPa,低於 PressureVision 的 1.93 kPa。加入純接觸的 HOI 資料後,ARCTIC 裸手逐頂點接觸 F1 從 0.069 升至 0.498,而 OpenTouch 的壓力表現大致保持不變,顯示共同網格確實能吸收異質監督。

限制同樣明顯:在 PressureVisionDB 的像素接觸 IoU,HOPE 為 0.328,仍低於原生平面模型的 0.547,因網格投影會累積手部重建誤差。野外影片只有定性展示,沒有真實壓力量測可驗證;左手還是由鏡像送入右手模型處理。研究頁雖提供互動結果,程式與權重仍標示為 soon。具身操作研究者接下來應關注跨手型、切向力、物體反作用力與真實機器人控制的閉迴路驗證。

來源

  1. HOPE: Hand-Object Pressure Estimation from Monocular Videos
  2. HOPE project page