具身 AI/機器人
RynnBrain 1.1 將接觸點與原生 3D 定位納入具身基礎模型,並跨三種機器人訓練 VLA
阿里巴巴達摩院發布 2B、9B 與 122B-A10B 三種 RynnBrain 1.1 模型,新增接觸點預測及原生 3D grounding。配套 RynnBrain-VLA 以統一動作空間跨 Unitree G1、Astribot-S1 與天機舞姬訓練,但跨硬體泛化仍主要由團隊自有實驗支持。

阿里巴巴達摩院公開 RynnBrain 1.1,把具身模型從「看懂場景」推近到可供控制策略使用的空間表徵。系列包含 2B、9B,以及總參數 122B、每次啟用約 10B 的 MoE 版本;共同處理具身感知、時空推理、定位與規劃,並新增接觸點預測。2B 與 9B 版本另支援原生 3D grounding,讓模型輸出不只指出影像區域,也能描述物體在三維空間的位置及可操作部位。
更值得注意的是 RynnBrain-VLA。團隊建立跨本體的統一動作空間,再用 embodiment-specific masking 隱藏特定機器人不具備的關節或控制維度,試圖讓同一策略同時吸收 Unitree G1、Astribot-S1 與天機舞姬的資料。這種做法若能成立,可減少每換一套硬體就重建模型與資料管線的成本;模型權重、程式碼及展示資源也已開始公開。
論文稱,122B-A10B 在 VSI-Bench、MMSI 與 RefSpatial-Bench 超過受測的開放及封閉模型;由 RynnBrain 初始化的真機策略,也優於團隊採用的 Qwen 基線與若干通用 VLA。這些數字仍不能直接等同部署可靠度:測試機型與任務由作者選定,不同機器人的控制頻率、相機標定、動力學及安全限制都可能影響遷移效果。工程團隊接下來應觀察公開權重能否重現結果、2B 模型的端側延遲,以及未參與訓練的新本體是否仍能低成本適配。