ホームへ戻る

機器人與模型評測

実機ロボットアーム試験でGPT-6 Astraが運搬タスク19/20を達成、精密挿入は依然2/20にとどまる

RoboCurveは、GPT-6 AstraとClaude Fable 5.1に同一のエージェントポリシーを用いて同じ双腕ロボットを制御させた。その結果、単純な運搬タスクでは大きな差がついた。一方、パズルピースをくぼみに正確に挿入するよう求めると、両モデルとも成功はわずか2回で、視覚言語エージェントが依然として接触制御と誤差修正の制約を受けていることが示された。

Sánchez-Soriano N, Tear G, Whitington P, Prokop A. · CC BY 2.0 · Image source
zh-Hant

独立評価チームのRoboCurveは、GPT-6 Astraを2台のI2RT YAM 6自由度ロボットアームに接続し、3つのカメラ視点とオープンソースのInspect Robotsエージェントフレームワークを通じて、2種類の実世界操作タスクを実行した。第1のタスクは、赤いブロックをつかんでボウルに入れるというものだった。20回の試行でAstraは19回、Claude Fable 5.1は8回、Fable 5は1回成功した。Astraは1回あたり平均2.5分を要し、約2,100 tokenを出力し、推定モデル費用は0.94米ドルだった。一方、Fable 5.1は6.8分、12,900 token、2.12米ドルだった。

しかし、第2の精密挿入タスクでは結論が変わった。モデルは円形のパズルピースの中央にあるつまみをつまみ、ボード上のくぼみに位置を合わせて挿入しなければならなかった。AstraとFable 5.1はいずれも、20回中わずか2回しか成功しなかった。Astraは何度も物体をくぼみの上まで移動させることには成功したものの、最後の姿勢調整、接触、挿入の各段階で行き詰まった。これは、より優れたシーン理解、計画速度、token効率が、自動的により安定した閉ループ精密制御へつながるわけではないことを示している。実世界で動作するエージェントにとっては、エンドエフェクタの誤差、深度知覚、制御周波数、失敗後の局所的な修正も同様に重要だ。

今回の評価は、単発のデモ動画よりも検証しやすい。RoboCurveは全120回の試行について、試行ごとのスコア、トランスクリプト、動画、再実行用データを公開した。Inspect Robotsは、パース済みの設定、Gitコミット、パッケージバージョンを保存し、実行前に観測空間、行動空間、制御レートを検証する。ただし、各モデルの各タスクにおける試行回数は20回にすぎず、スコアは到達した最高の完了段階に基づいて人手で判定され、費用も当時のAPI価格から推定されている。この結果は19回と8回の差を示すには十分だが、いずれも2/20だった2つのモデルが実際に同等であると証明するには不十分だ。今後特に必要なのは、物体の種類、遮蔽、外乱条件を増やすことに加え、力覚または幾何学的指標による評価を自動化することだ。それにより、単一の単純なタスクで得られた高い成功率を、汎用的なロボット能力へ安易に一般化することを避けられる。

出典

  1. GPT-6 Astra on robotic manipulation
  2. Inspect Robots: open-source evaluations for physical AI
  3. GPT-6 Astra scores 95% on one robot task, 10% on another