返回首頁

機器人與代理工具

COMPASS 把跨機器人導航訓練封裝成 Codex/Claude Code Skills

NVIDIA 為 COMPASS 加入代理驅動工作流程,讓 coding agent 協助驗證環境、準備場景、訓練 residual policy 及比較 checkpoint。代理只負責開發編排,實際導航仍由匯出的視覺策略與 ROS 2 控制器執行。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

NVIDIA 公開 COMPASS 的代理式訓練流程,把原本分散於 Isaac Sim、Isaac Lab、場景轉換、強化學習及 ROS 2 的操作封裝成 repository skills。開發者可在 Codex 使用 `$compass`,或在 Claude Code 呼叫 `/compass`,要求 coding agent 檢查容器、GPU、模型及資產版本,建立 occupancy map、執行單環境 smoke test、啟動長時間訓練,再保存日誌、遙測、checkpoint 與 artifact manifest。

COMPASS 並非讓語言模型直接控制機器人。其底層先重用 X-Mobility 的模仿學習策略,再以 residual reinforcement learning 為特定機器人與場景訓練修正器;多個 specialist 之後可蒸餾為共用的跨 embodiment 策略。官方模型卡列出 G1、H1、Carter 與 Spot,輸入包括 RGB 影像、機器人速度、路徑及 embodiment 類型,輸出則是線性與角速度。參考 ROS 2 整合把相機、里程計及目標轉成模型輸入,再向 `/cmd_vel` 發布控制命令。

新流程提供三條場景路徑:已註冊的倉庫可作可重現基線;SAGE-10K 提供 50 種房型、共一萬個生成室內場景;NuRec 則把實地雙目 RGB 拍攝轉成 Isaac Sim 可用的重建環境。代理在場景接受、smoke test 與 checkpoint 升級前均須停下等待人工批准,評估時亦要求基礎策略與 residual checkpoint 使用相同 seed、目標、初始狀態及終止條件,並同時比較抵達率、跌倒率與行程時間。

這套設計的技術價值,是把容易因版本、座標系或場景資產而失敗的機器人訓練流程轉成可稽核的代理工作流,而不是宣稱模型能力突然提升。官方沒有公布此次 Skills 導入後的成功率、訓練時間或跨機器人增益;教學也停在 checkpoint 評估,ONNX/TensorRT 匯出與實機部署仍須另行驗證。程式碼採 Apache 2.0,但模型及模擬資產需接受 NVIDIA 條款,且官方明確表示 COMPASS 未針對功能安全或高度動態環境完成驗證。

來源

  1. How to Train a Cross-Embodiment Robot Navigation Policy with AI Agents
  2. NVlabs/COMPASS
  3. NVIDIA COMPASS model card