AI 研究
RECLAIM、100本の論文で研究エージェントを評価 完全な資料があるグループの再現率は最高41%
ベンチマークでは、エージェントが自ら環境を構築し、デバッグして実験を実行。その後、独立したモデルが実行証拠を審査する。公開されたコードと実行記録を使って開発者は失敗箇所を追跡できるが、結果は評価対象モデルの範囲と各条件1回のテストに限られる。

RECLAIMの研究チームは9月23日、研究エージェントが論文に記載された特定の実験結果を再現できるかを評価する新たなプレプリントを公開した。ベンチマークはNeurIPS 2025の論文100本を対象とし、エージェントはパッケージのインストールや依存関係の競合解消から実験の実行までを自ら行い、検証可能な証拠を残す必要がある。[論文](https://arxiv.org/abs/2609.28850)、[プロジェクトの説明](https://github.com/mithils3/reclaim)
タスクは、原著者が公開した資料に応じて3種類に分かれる。Runではコード、データ、重みが提供される。Retrainでは重みがなく、再学習が必要だ。Reimplementではコードがなく、論文をもとに手法を再構築する。各タスクには評価指標、適用範囲、判定方法が定められ、GPU予算は最大96 H100換算時間となっている。エージェントは目標値を確認できるが、その値を生み出した実験設定は直接与えられないため、論文を読み、実験を設計しなければならない。[タスク仕様](https://github.com/mithils3/reclaim#match-target-and-tolerance)
評価では、エージェント自身による成功の申告と、実際の合格判定を分けている。固定の審査モデルClaude Sonnet 5が実行証拠と各ラウンドの記録を確認し、0点から10点で採点する。再現成功と認められるのは8点以上で、証拠の完全性に重大な問題があれば0点となる。公開記録にはツールのコマンド、標準出力、エラーメッセージが残り、読者は結果の生成過程と審査理由を確認できる。[実行記録ビューアー](https://reclaim-traces.vercel.app/)
論文によると、DeepSeek-V4-FlashはRunで34問中14問に成功し、成功率は約41%だった。Retrainでは33問中9問、約27%だった。Reimplementで最も高い成績を収めたのはMuse Spark 1.2で、33問中5問、約15%だった。各グループに含まれる論文は異なるため、この差を、同一のコードや重みを取り除いた場合の因果効果とみなすことはできない。[結果と手法](https://arxiv.org/html/2609.28850v1)
研究ツールの開発者にとって、ここから得られる工学的な示唆は、実際の成果物に基づいて合否を判定することだ。目標値は測定証拠と結び付け、実験は指定された範囲に沿って行う必要がある。データの各項目には比較の方向、許容誤差、証拠が記録されたファイルが示され、別の審査者が判定を再確認できる。部分的な再現、検証不能、失格にもそれぞれ別のラベルが付く。リポジトリには固定されたデータ分割、プロンプト、採点規則、実行ツールが公開されており、エージェントのワークフローを改善するためのテストの出発点として利用できる。[公開された実装](https://github.com/mithils3/reclaim)
結果には明確な限界もある。各モデルと論文の組み合わせは最大1回しか試されておらず、Claude、GPT、Geminiは評価対象のエージェントに含まれていない。また、同一のクラスターで人間による全面的な再現実験を実施していないため、すべての誤差をエージェントに帰することはできない。今後は反復テストと人間によるベースラインを加え、改善が安定して検証可能な研究成果につながるかを確かめる必要がある。[研究の限界](https://arxiv.org/html/2609.28850v1#S6)