返回首頁

機器人與具身 AI

HiFi-UMI 以毫米級穿戴式資料直接訓練機器人,後訓練不再需要真機示範

HiFi-UMI 將離線立體慣性 SLAM、微秒級同步與雙手六視角整合成可攜式資料系統,使純人類操作資料能直接用於機器人後訓練。三種 VLA/世界動作模型的實機成功率接近場內遙操作基線,但結果仍集中於單一團隊的受控任務。

Internet Archive Book Images · No restrictions · Image source
zh-Hant

機器人策略通常不能只靠人類第一視角影片完成最後訓練:穿戴式 Universal Manipulation Interface(UMI)容易擴充,卻存在軌跡漂移、雙手相對姿態不準、相機不同步及視野遮蔽,因此業界多把它用於預訓練,再以少量真機遙操作資料校正。HiFi-UMI 嘗試移除這個「真機錨點」,把資料品質提升到可直接部署的程度。

系統以頭戴式離線 stereo-inertial SLAM 重建軌跡,直接量測而非事後推算雙夾爪相對姿態,並用共用 GPIO 觸發器將感測器同步誤差壓到 40 微秒以下。每隻手配置兩顆廣角相機,合計六個視角、每手約 200 度視野;論文報告工作空間內末端執行器定位誤差約 3 毫米。資料還會經自動軌跡重建、模擬重播與品質驗證,降低錯誤示範進入訓練集的機率。

團隊只以 HiFi-UMI 示範後訓練 StarVLA-QwenPI、OpenPI-π0.5 與 LingBot-VA,實機成功率相對場內遙操作基線分別相差 −2.5、+3.1 與 −0.6 個百分點;最佳策略在精密插入任務達 85%。另以同系統蒐集的 4,000 小時資料預訓練,在十項未見任務將動作誤差降低 41%,並使 StarVLA-QwenPI 實機成功率再提高 18.1 點。

公開的 HiFi-UMI-2K 包含逾 2,000 小時、48.2 萬條可重播示範及 110 多個場景,採 CC BY 4.0。工程上真正值得追蹤的是第三方能否用不同機器手臂、控制頻率及相機標定重現結果,以及長時間 SLAM 漂移、接觸力與末端工具差異是否仍需少量真機校正;目前數字不能直接證明昂貴的機器人資料已可全面由穿戴式採集取代。

來源

  1. HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
  2. HiFi-UMI project page
  3. HiFi-UMI-2K dataset