機器人與具身 AI
Isaac 0.5、動画理解とロボット制御を統合するも、将来知覚の中核的な訓練目標は依然非公開
Perceptron AIは、360億パラメータのIsaac 0.5の重みとLeRobot統合を公開し、同一のスパースなバックボーンから言語、空間座標、連続または離散アクションを出力できるようにした。一般動画によって遠隔操作データの必要量を大幅に削減できると公式は主張するが、これはオフラインのaction lossに基づく換算であり、中核となる自己教師あり学習目標は依然としてプロプライエタリ技術である。

Perceptron AIはIsaac 0.5を公開した。これは、動画理解、身体性推論、空間定位、タスク進捗推定、ロボット制御を単一のバックボーンに統合した360億パラメータのモデルだ。チームは同時に、重み、訓練・推論コード、LeRobot統合、リファレンスpolicy server、ならびに35種類を超えるロボット構成向けのデプロイ資料を提供している。
IsaacはQwenシリーズの視覚言語バックボーンを基盤とし、各MoE層には256個のルーティング対象エキスパートと1本のnull routeが含まれる。テキスト、画像、状態、アクションの各tokenは、0~8個のエキスパートに加え、共有エキスパートと残差経路を利用できる。技術レポートによると、この超スパース構成でtoken当たり平均約25億パラメータのみがアクティブになる。離散制御には、独立した2,048個のFAST action tokenを採用。連続制御では、バックボーンの状態を条件としてFlow expertを動作させ、36層のdiffusion transformerを通じてアクションチャンクを生成する。モデルは現在のチャンクの実行中に次のアクション区間を予測でき、閉ループ制御の待ち時間を短縮する。
訓練データには、一般動画100万時間、第一人称視点動画37万5,000時間、UMIハンドヘルドグリッパー動画37万5,000時間に加え、ロボット、ゲーム、シミュレーションの経験データ10万時間が含まれる。著者らは、オフライン評価でaction loss 2.50を固定のしきい値とした場合、一般動画を1,000時間から100万時間へ増やすことで、必要な遠隔操作データを5,884時間から28時間へ削減できると推定している。
この210倍という数字は、実機ロボットの成功率を示すものではなく、特定ハードウェアのデモンストレーションデータを動画が同じ比率で代替できることを証明したものでもない。さらに重要なのは、将来フレームを「percept」目標へ変換する構築手法とloss実装が依然として公開されていない点だ。現時点では、クリーンなcheckoutだけで訓練や推論の全工程を実行することもできず、mHarmonyやTensorStreamなどのコンポーネントを別途構成する必要がある。今後は、ロボット間での再現性、実環境における閉ループ成功率、そしてプロプライエタリな目標が訓練全体の再現を妨げるかどうかに注目すべきだ。