返回首頁

機器人與具身 AI

VLANeXt 擴充為統一 VLA 研究底座,涵蓋世界模型與潛在動作預訓練

VLANeXt 的重大程式庫更新把世界動作模型、JEPA 類世界建模及潛在動作學習放進同一套訓練與評測框架。團隊在 LIBERO-plus 報告 83.9% 平均成功率,但結果仍需跨程式庫與實體機器人獨立重現。

Rachel Boettcher, U.S. Air Force · Public domain · Image source
zh-Hant

VLANeXt 團隊在 8 月 31 日公布重大程式庫升級,把原先用來拆解視覺—語言—動作模型設計的研究程式碼,擴展為可比較多種機器人學習路線的統一底座。新版支援 World Action Model、潛在動作預訓練與微調、JEPA 類世界建模、小型 VLA、語言—動作學習、更多資料格式及平行評測;原始論文版本則保留在 `VLANeXt-ori` 分支,避免新抽象層破壞既有結果的重現路徑。

VLANeXt 的設計出發點,是在相同訓練與評測條件下分離 VLA 系統中容易混雜的選項。團隊整理的十二項配方包括:讓 VLM 與專用 policy module 分工、一次預測 action chunk、以連續值而非離散 token 表示動作、使用較強的視覺語言骨幹、在 VLM 與策略間採柔性連接,以及把機器人 proprioception 納入條件。歷史影格不一定能穩定改善結果;世界模型可能有幫助,卻會顯著增加計算量。這些選項現在可在共用設定及資料管線中切換,比逐一拼接不同論文程式庫更適合做消融實驗。

官方在 LIBERO-plus 的相機、光線、背景、語言改寫、機器人狀態及場景配置擾動下,報告 VLANeXt 平均成功率為 83.9%,高於 OpenVLA-OFT 的 69.6%。訓練可使用重新整理及篩選過的 MolmoAct2-DROID 資料,評測則涵蓋 LIBERO 與 LIBERO-plus。

這次更新的重要性在研究基礎設施,而不只是排行榜名次:同一底座能減少資料處理、策略頭及評測腳本差異造成的比較偏差。不過,數字由作者在其設定下產生,資料重整也可能影響公平比較;LIBERO 成功率不能直接代表真實機械臂的安全性、長期可靠度或跨硬體泛化。採用者還須注意專案使用 NTU S-Lab License,商業用途不應預設等同 Apache 2.0。

來源

  1. VLANeXt: A Simple and Research-Oriented Codebase for Robotics Research
  2. VLANeXt official implementation
  3. VLANeXt: Recipes for Building Strong VLA Models