機器人與具身 AI
GigaBrain-0.7 開放 3.5B VLA 權重與訓練程式,涵蓋八種機器人配置
GigaAI 公開 GigaBrain-0.7 的基礎權重、訓練管線及機器人部署範例,模型以 3.73 萬小時異質具身資料預訓練。論文中的三系統架構與領先成績仍未完整可重現,官方評測程式目前也在待辦清單。

GigaAI 在 8 月 25 日把 GigaBrain-0.7 的程式、3.5B 基礎模型及範例資料加入既有開源專案,令 8 月 16 日發表的技術報告首次具備可下載、可訓練的實作。公開模型以 PaliGemma2 為視覺語言骨幹,配合逐層交織的連續動作專家;官方消融顯示,這種 dual-stream 接法在三項實機任務勝過只讀取最後一層或逐層 cross-attention 的版本,但推論時間亦由最快版本的 0.073 秒增至 0.221 秒。
完整設計把能力拆成三個系統:System 1 產生低階動作,System 2 利用歷史影像追蹤進度並分解長任務,System 3 則以世界模型預測未來影像及估計狀態價值。預訓練資料共約 3.73 萬小時,包含實機、UMI、第一人稱、模擬及世界模型生成軌跡,橫跨 16 種機器人形態與約 2.7 億組視覺—語言樣本。公開管線採 LeRobot 格式,以 embodiment ID、動作遮罩及各資料集正規化統計處理不同控制空間;倉庫已提供 AgileX Cobot Magic 與 Maker H01 的訓練、推論伺服器及 ROS 用戶端範例。
論文在 RoboColiseum 報告指令遵循 0.8166、空間推理 0.4729、穩健性 0.6800及一般操作 0.6092,四項均高於列出的公開基線。不過這些比較仍由作者整理,部分實機結果使用任務專屬示範再微調,不能解讀成完全零樣本能力。更重要的是,倉庫仍把 VLM、RoboColiseum、RoboTwin 2.0及 EBench 評測程式列為待發布項目;目前開放的亦只是範例資料,而非完整 3.73 萬小時語料。工程團隊下一步應確認三系統推論能否由公開元件端到端重建,以及第三方能否在相同機器人與 benchmark protocol 重現成績。