具身 AI/評測
GAUGE 以 1,560 次實體實驗檢驗模擬器與影片世界模型,沒有單一引擎全面勝出
GAUGE 將物理引擎與生成式世界模型放到同一套實測基準,從軌跡、方程形式及物理參數分別診斷誤差。結果顯示,畫面合理或符合方程形式,仍不代表加速度、動量轉移與振盪週期正確。

GAUGE 將具身 AI 常用的數值模擬器與生成式影片模型,首次放進由實體量測支撐的共同診斷框架。資料集包含 22 類受控任務及約 1,560 次動作捕捉實驗,涵蓋剛體碰撞與摩擦、繩索、布料,以及泡棉等體積可變形物;研究人員另以傾斜平面、材料壓縮及數位影像相關等方法校準摩擦係數、楊氏模數與蒲松比,避免只拿另一個模擬器當「真值」。
物理引擎部分在 14 類任務比較 Isaac Sim、Genesis 與 Newton,依任務採用軌跡 RMSE、動態時間校正、動量傳遞效率、振盪週期及能量損失等指標。結果不存在通用冠軍:Isaac Sim 在部分剛體接觸與旋轉平台任務較準;Genesis 對動態布料及多數可變形體較有競爭力;Newton 則在特定變形情境領先。衝擊接觸、快速布料運動及體積變形仍是共同弱點,意味機器人策略可能學到特定引擎的誤差,而非可轉移的物理規律。
另一條測試以五項剛體任務評估 Cosmos3、Wan、Seedance 2.0 與 Genie 3 等六套生成系統。GAUGE 從影片追蹤物體,再分別檢查軌跡是否符合預期方程、反推出的參數是否接近實測值,以及參數能否隨時間保持穩定。部分影片雖可被正確形式的運動方程良好擬合,估出的加速度、碰撞動量或擺動週期卻明顯錯誤;加入負向提示也可能改善一項任務、同時令另一項惡化。
工程上,這提醒團隊不要只以視覺品質或單一 sim-to-real 成功率選擇訓練環境。下一步應觀察資料、場景重建程式與完整評測管線是否公開,以及不同引擎版本、求解器參數與影片取樣率能否重現排名。現階段影片模型只測五類剛體場景,尚不能把結論直接延伸至布料、軟體或真實機器人控制。