返回首頁

機器人與模型評測

實體機械臂測試顯示 GPT-6 Astra 在搬運任務達 19/20,精密插入仍只有 2/20

RoboCurve 讓 GPT-6 Astra 與 Claude Fable 5.1 使用相同代理政策控制同一組雙臂機器人,結果在簡單搬運任務拉開差距。要求把拼圖精確插入凹槽後,兩款模型都只成功兩次,顯示視覺語言代理仍受接觸控制與誤差修正限制。

Sánchez-Soriano N, Tear G, Whitington P, Prokop A. · CC BY 2.0 · Image source
zh-Hant

獨立評測團隊 RoboCurve 把 GPT-6 Astra 接上兩支 I2RT YAM 六自由度機械臂,透過三個攝影機視角與開源 Inspect Robots 代理框架完成兩項實體操作。第一項要求抓起紅色積木並放入碗中;Astra 在 20 次試驗成功 19 次,Claude Fable 5.1 為 8 次,Fable 5 為 1 次。Astra 每次平均耗時 2.5 分鐘、輸出約 2,100 token,估算模型費用 0.94 美元;Fable 5.1 則為 6.8 分鐘、12,900 token 與 2.12 美元。

但第二項精密插入任務改變了結論。模型必須捏住圓形拼圖片中央旋鈕,再把它對準板上的凹槽;Astra 與 Fable 5.1 都只在 20 次中成功 2 次。Astra 多次能把物件移至凹槽上方,卻在最後的姿態調整、接觸與插入階段停滯。這表示較好的場景理解、規劃速度或 token 效率,不會自動轉化為更穩定的閉迴路精密控制;對實體代理而言,末端執行器誤差、深度感知、控制頻率與失敗後的局部修正同樣關鍵。

這次評測比單一展示影片更可檢查:RoboCurve 公開全部 120 次試驗的逐次分數、轉錄、影片與重跑資料;Inspect Robots 儲存解析後設定、Git 提交與套件版本,並在執行前驗證觀察空間、動作空間及控制率。不過每個模型、每項任務只有 20 次,評分由人工依最高完成階段決定,而且成本採當時 API 價格估算。結果足以顯示 19 次與 8 次的差距,卻不足以證明兩個 2/20 的模型真正等效。後續最需要的是更多物體、遮擋與擾動條件,以及自動化力覺或幾何評分,避免把單一簡單任務的高成功率外推成通用機器人能力。

來源

  1. GPT-6 Astra on robotic manipulation
  2. Inspect Robots: open-source evaluations for physical AI
  3. GPT-6 Astra scores 95% on one robot task, 10% on another