ホームへ戻る

電腦視覺與具身 AI

HOPE、単眼動画から手の圧力を予測――OpenTouchで頂点単位の接触F1が0.660に

HOPEは、触覚グローブ、平面センサー、接触のみのアノテーションをMANOの手メッシュへ統一的にマッピングする。一般的なRGB動画から頂点単位の圧力と接触を出力できるが、公開ページでは現在もコードとモデルが「近日公開」と表示されている。

George Frederic Watts and workshop · Public domain · Image source
zh-Hant

視覚モデルは通常、手が物体に触れているかどうかしか判定できない。力の大きさを推定する既存手法の多くは、平面型圧力マット、単一画像、または特定センサーの座標系に依存している。HOPEはこの問題を、手を中心とした動画予測として再定式化した。物体の形状やセンサー配置にかかわらず、出力をMANOの手メッシュ上における頂点単位の接触確率と法線圧力として表現するため、同一の表現を用いて複数のデータソースを横断した学習が可能になる。

システムはまず、OpenTouch触覚グローブのtaxel、PressureVisionDBの平面計測値、さらにDexYCBとARCTICの距離ベースの接触アノテーションを共通メッシュへ投影する。VertexFormerは、各手頂点をフレーム間で持続するtokenとして扱い、頂点self-attention、DINOv3の画像patchに対するcross-attention、temporal attentionを交互に実行する。手の姿勢には、HaWoRなどの外部再構成器による推定結果を使用する。圧力headには接触ゲート `p̂ = ĉ ⊙ p̃` を採用し、「接触がなければ圧力もない」という制約をアーキテクチャへ直接組み込んでいる。これにより、力の値を持たない接触データからも圧力分布を制約できる。

OpenTouchのホールドアウトテストセットでは、HOPEのframe-level接触F1は0.874、vertex-level F1は0.660だった。HACOはそれぞれ0.835と0.361だった。HOPEの頂点単位の圧力MAEは1.808 kPaで、PressureVisionの1.93 kPaを下回った。接触のみを含むHOIデータを追加すると、ARCTICの素手データにおける頂点単位の接触F1は0.069から0.498へ向上した一方、OpenTouchでの圧力性能はおおむね維持された。これは、共通メッシュが異種の教師信号を実際に取り込めることを示している。

一方、制約も明確だ。PressureVisionDBにおけるpixel-level接触IoUは、HOPEが0.328で、平面表現を直接扱う元来のモデルの0.547を依然として下回る。メッシュへの投影によって、手の再構成誤差が蓄積するためだ。実環境動画については定性的な結果しか示されておらず、検証に利用できる実測圧力データもない。また、左手は現在も画像を反転させ、右手用モデルへ入力して処理している。研究ページではインタラクティブな結果が公開されているものの、コードとweightsは引き続き「soon」と表示されている。Embodied manipulationの研究者は今後、異なる手形状への汎化、接線力、物体からの反力、実ロボット制御におけるclosed-loop検証に注目すべきだろう。

出典

  1. HOPE: Hand-Object Pressure Estimation from Monocular Videos
  2. HOPE project page