AI 研究
AgenticGenPlan、評価時に言語モデルを呼び出さずロボット計画プログラムを生成
28種類のシミュレーション環境で再利用可能な制御プログラムを評価。従来型プランナーと比較可能な環境のサブセットでは、平均成功率が最高95%に達した。結果は完全観測可能な状態に限られ、再現にはブラックボックス権限、評価シード、事前の合成コストの確認が必要だ。

9月24日に公開されたAgenticGenPlanの研究では、プログラムエージェントがまずシミュレーターを探索し、複数の問題インスタンスで再利用できるロボット制御プログラムを生成する。著者らはClaude CodeとOpus 5、CodexとGPT-5.6 SolおよびGPT-6 Astraを組み合わせて評価した。対象は28種類の環境で、980本のプログラムを生成し、98,000回の評価を実施した。プログラムは完成後に凍結され、テスト段階では大規模言語モデルを呼び出さない。[論文](https://arxiv.org/html/2609.30233v1)
この手法が扱うのはタスク・アンド・モーション・プランニング(TAMP)だ。たとえば、どの障害物を先に移動させるかを決める際、ロボットアームがそこに届くか、衝突が起きないかも同時に考慮する。主実験でエージェントに与えられたのは、タスクの説明、シミュレーターのインターフェース、Python、NumPy、SciPyのみ。エージェントは隔離コンテナ内で自らテストを設計し、方策を修正するが、環境のソースコードは読めない。合成ごとのモデル使用料の上限は20ドルで、各手法と環境について独立した実験を5回行った。生成した各プログラムは、保留された100個のインスタンスでテストされ、各インスタンスの制限時間は60秒だった。[実験設定](https://agenticgentamp.github.io/)
同じ環境内のインスタンスでは、物体の数、配置、形状が変わる一方、状態、アクション、報酬の定義は共通している。したがって、ここでいう汎化とは主に、同種の問題における新しい配置への適応を指す。未知のロボットを操作できるという意味にはそのまま解釈できない。[タスクの定義](https://agenticgentamp.github.io/)
従来型プランナーが用意されている16種類の環境では、GPT-6 Astra、Opus 5、GPT-5.6 Solの平均成功率はそれぞれ95%、82%、56%で、プランナーは47%だった。一方、28種類すべての環境でのAstraの平均成功率は86%であり、95%を評価全体の成績とみなすことはできない。エンジニアリングの観点では、この手法は探索と推論のコストを方策生成時にまとめ、その後はプログラムを再利用して新しい配置に対応する。論文の実行時間比較には、事前の合成コストが含まれていない。[結果と計測時間の定義](https://arxiv.org/html/2609.30233v1)
限界も明確だ。研究では物体の状態を完全に観測できる設定を用いており、知覚誤差がある場合の性能は検証されていない。一部の3次元動的タスクは依然として難しく、モデルの訓練データが非公開であるため、ベンチマーク汚染の可能性を完全には排除できない。このプレプリントが示すのはシミュレーション環境での証拠であり、実機ロボットへの汎化能力は今後の検証を待つ必要がある。[研究の限界](https://arxiv.org/html/2609.30233v1)
公開コードは今後の検証の足がかりになるが、デフォルト設定をそのまま使っても主実験を再現できるとは限らない。リポジトリによると、`approach=agentic`だけを設定した場合もソースコードへのアクセスは可能なままで、厳格なブラックボックス用オプションを別途有効にする必要がある。元の評価シードは著者に問い合わせる必要がある。エンジニアリングチームが増分の効果を自社のワークロードに適用できるか判断するには、ツールのバージョン、アクセス権限、評価シードを固定し、方策生成費用と実行コストを分けて計算する必要がある。[再現ガイド](https://github.com/tomsilver/robocode)