AI 研究
ExplorationBench、異例のルールを備えたサンドボックスでエージェントの探索・知識活用能力を分析
10種類のAIシステムに未知のルールを自力で探らせた後、ツールを無効にして知識の活用を検証した研究では、探索を重ねても成績が下がる場合があることが分かった。テスト問題は未公開で、プロジェクトページと論文では一部のスコアにも差がある。

復旦大学、Tencent Hunyuan、清華大学のチームは9月24日、エージェント評価を「自ら証拠を集め、新しいルールを適用する」段階へと進める ExplorationBench を提出した。この研究では、実行可能な2つのサンドボックスで10種類のAIシステムをテストし、モデルが既存の認識を修正できるか、また得た知識を未経験のタスクに活用できるかを調べた。[論文](https://arxiv.org/abs/2609.30199)
2つの環境では、慣れ親しんだ操作が意図的に通用しないようにしている。AlienCode には31個の発見対象があり、たとえば整数リテラルをまず27とXORすると、`EMIT(100)` の出力は127になる。AlienLogic では24個の推論ルールを変更している。各環境には保留テスト問題が70問あり、回答はインタープリターまたは証明チェッカーで検証される。証明不可能と指定された命題については、正しく証明を拒否した場合にのみ得点となる。この仕組みにより採点結果を直接検証でき、言語モデルを判定役に使う場合に生じる判断のばらつきを抑えられる。[プロジェクトの説明](https://www.explorationbench.com/)
実験は、誤りを含む同一のマニュアルと固定された例を出発点とする。エージェントは4ラウンドにわたって探索し、プログラムや証明を自ら選んでプローブとして実行し、環境からのフィードバックを受け取る。各ラウンドの終了時には会話の複製を作り、ツールを無効にしたうえでルールを説明して問題に回答させる。そのテスト用の複製はその後破棄される。プロセス全体を通じて重みは更新されないため、測定対象は単一のコンテキスト内で知識を獲得し、活用する能力であり、セッションをまたぐ長期学習は対象外だ。[著者による解説](https://www.explorationbench.com/blog/)
論文 v1 によると、Claude Opus 5 は AlienCode の独立した3回の探索で、最終スコアの最高値が87.6%、平均が72.5%、最低が49.0%だった。このばらつきは、最高スコアだけでは安定した性能を示せないことを表している。30本のプログラム探索軌跡のうち6本では、最終スコアがそれ以前のラウンドより少なくとも3ポイント低かった。メインのランキングでは3回のうち最高値を取る Best@3 が使われているが、エンジニアリング評価では平均値、最低値、探索コストも併せて確認すべきだ。[結果と評価方法](https://arxiv.org/html/2609.30199v1)
研究エージェントの開発者は、この結果を踏まえ、記憶の中にルールを裏付ける証拠と適用条件を保持させることで、後続の推論がそれまでに得た正しい発見を覆す事態を減らせるか検証できる。これは実験から導かれるエンジニアリング上の仮説であり、効果は実際のワークフローで検証する必要がある。
現時点では、確認上の制約が2点ある。プロジェクトページには AlienCode の最高スコアとして89.0%が掲載されているが、論文 v1 の87.6%とは異なるため、両者を混同してはならない。また、サイトにはテスト問題は未公開と明記されており、外部のモデルで評価するにはチームに連絡して代行測定を依頼する必要がある。そのため、この研究は検討に値する評価設計を示しているものの、公開資料だけでは第三者が完全に再実行するには不十分だ。今後は、スコアのバージョン間の整合、評価資料の公開、同じ予算で試行回数を増やした場合の安定性に注目したい。[公式評価ページ](https://www.explorationbench.com/)