機器人與具身 AI
Isaac 0.5 統一影片理解與機器人控制,但關鍵未來感知訓練目標仍未開放
Perceptron AI 釋出 360 億參數 Isaac 0.5 權重及 LeRobot 整合,讓同一稀疏骨幹輸出語言、空間座標與連續或離散動作。官方宣稱一般影片可大幅減少遙操作資料需求,但這是離線 action loss 的換算,且核心自監督目標仍屬專有技術。

Perceptron AI 公開 Isaac 0.5,一個把影片理解、具身推理、空間定位、任務進度估計及機器人控制放進同一骨幹的 360 億參數模型。團隊同步提供權重、訓練與推論程式、LeRobot 整合、參考 policy server,以及超過 35 種機器人配置的部署資料。
Isaac 以 Qwen 系列視覺語言骨幹為基礎,每個 MoE 層包含 256 個路由專家及一條 null route;不同文字、影像、狀態或動作 token 可選擇零至八個專家,再加上共享專家與殘差路徑。技術報告稱,超稀疏設定平均每 token 只啟用約 25 億個參數。離散控制採用獨立的 2,048 個 FAST action token;連續控制則由骨幹狀態條件化一個 Flow expert,再透過 36 層 diffusion transformer 產生動作區塊。模型可在目前區塊執行期間預測下一段動作,以縮短閉環控制等待時間。
訓練資料涵蓋 100 萬小時一般影片、37.5 萬小時第一人稱影片、37.5 萬小時 UMI 手持夾爪影片,以及十萬小時機器人、遊戲與模擬經驗。作者在固定 action loss 2.50 的離線門檻下,估計把一般影片由一千小時增加至一百萬小時,可把所需遙操作資料由 5,884 小時降至 28 小時。
這個 210 倍數字不是實體機器人成功率,也未證明影片能按相同比例取代特定硬體的示範資料。更重要的是,將未來畫面轉成「percept」目標的建構方法與 loss 實作仍未公開;乾淨 checkout 目前也不足以完成全部訓練或推論,尚需另行配置 mHarmony、TensorStream 等元件。後續應關注跨機器人重現、真實閉環成功率,以及專有目標是否妨礙完整訓練重現。