返回首頁

具身 AI

MiniCPM-Robot 將串流視覺記憶與動作模型壓進 1.5B,並補齊 Go2 本機部署路徑

OpenBMB 更新 MiniCPM-Robot 的權重、程式與部署文件,讓單一 1.5B VLA 處理多項操作任務,另以 0.9B 模型執行目標追蹤。串流上下文與客製推論核心降低重複視覺計算,但官方基準仍不足以證明跨機器人泛化。

Zala · CC BY-SA 4.0 · Image source
zh-Hant

OpenBMB 在 7 月 19 日首次公開 MiniCPM-Robot,並於近兩日持續更新模型卡與部署材料。系列包含 MiniCPM-RobotManip 與 MiniCPM-RobotTrack:前者是 1.5B 參數的通用視覺—語言—動作模型,以同一組權重覆蓋模擬及實體操作;後者為 0.9B 追蹤策略,針對靜止、移動及對抗性目標設計。程式與權重採 Apache-2.0 授權。

RobotManip 的關鍵不是單純縮小參數量,而是避免每個控制週期重新編碼完整歷史。官方表示,保留 60 幀時,傳統重算每次決策需要約 125 TFLOPs,串流推論降至 3.3 TFLOPs;每幀視覺 token 亦由 256 壓到 64。模型可維持約一分鐘視覺記憶,在 H100、BF16、單幀設定下,模型前向延遲為 120 毫秒。不過該數字排除了自回歸動作解碼,不能直接視為完整控制延遲。

配套 PhyAI 透過 CUDA Graph 與 Triton 融合核心,把 H20 上的推論頻率由 10 Hz 提至官方宣稱的 37 Hz。RobotTrack 則提供 Unitree Go2 EDU、Jetson Orin NX 16GB、TensorRT 10.7 與 ROS 2 Humble 的部署流程,端到端約 180 毫秒、超過 5 FPS;預設 dry-run 也反映實體控制不能只看離線分數。

工程團隊接下來應關注三點:第三方能否重現 LIBERO、RoboTwin2 與 EVT-Bench 成績;串流狀態在遮擋、掉幀及長時間執行時是否漂移;以及同一策略移植至不同相機、關節與控制頻率後,需要多少重新蒸餾或微調。現階段成果更像可實驗的低延遲基線,而非已驗證的跨硬體通用機器人大腦。

來源

  1. OpenBMB/MiniCPM-Robot: A Smarter and Faster On-Device AI Brain for Robots
  2. MiniCPM-RobotManip model card and weights
  3. OpenBMB Open-Sources MiniCPM-Robot Series for Low-Latency Embodied AI