ホームへ戻る

AI 評測與科研代理

TruthInsightBench、論文の結論を伏せて科学研究エージェントを評価—4システムはいずれも約60点にとどまる

新しいベンチマークでは、研究目標と凍結済みデータのみを提供し、元論文の結論や想定された分析経路をエージェントに開示しない。4つのプログラムエージェントはいずれも分析を実行できたものの、対照実験、ロバストネス検証、反証可能な条件、データセット横断検証が総じて不足していた。

البرمجية: كلود لقطة الشاشة: أنون · Public domain · Image source
zh-Hant

TruthInsightBenchは、「既知の結果の再現」と「データから信頼できる発見を導き出すこと」を切り分けようとする試みだ。研究者は10の科学分野から査読済み研究を選び、計40件のブラインド評価タスクを作成した。エージェントに与えられるのは、中立的に記述された研究目標、凍結済みデータ、実行可能な環境のみで、元論文の結論、期待される数値、分析手順は開示されない。エージェントは、どの現象を調べ、どのような主張を提示するかを自ら決定し、コード、分析成果物、レポートを提出しなければならない。

評価器は単一の正解と直接照合するのではなく、エージェント自身が提示した発見を項目ごとに検証する。評価は、証拠の監査可能性、ロバストネス、対照テスト、データセット横断の汎化、新規性、反証可能性という6つの観点で構成され、さらに実行成果物によって裏付け可能な29項目に分けられる。レポートに記載されているだけで、実際には実行されていないテストは得点に含まれない。評価モデルには、思考モードを無効にした固定の量子化モデルを使用する。各項目をまず0、0.5、1のいずれかで判定し、その後、決定論的なルールで集計することで、評価ごとのコストとばらつきを抑える狙いがある。

同一の凍結済み基盤モデルを共有する条件では、Claude Code、OpenScience、Codex CLI、DeepSeek Harnessの平均スコアは58.40~60.27点にとどまった。40タスクに対するペアワイズ検定でも、統計的に有意な首位システムは確認されなかった。証拠の監査可能率は約80%に達した一方、代替手法、摂動、ネガティブコントロール、外部データによる検証はほとんど実行されていなかった。これは、現在のエージェントが分析を最後まで実行してレポートにまとめることには比較的長けているものの、表面的なシグナルが新たな現象なのか、数値上のアーティファクトなのか、データのバイアスなのかを見極める能力は、まだ十分ではないことを示している。

エンジニアリング上、このベンチマークは科学研究エージェントの回帰テストとして利用できるが、60点というスコアを汎用的な科学研究能力の指標と解釈すべきではない。実験は単一試行かつ1つの共通基盤モデルのみで行われている。また、エージェント向けプロンプト、デコーディングパラメータ、ツール制約、元の実行トレースも、公開パッケージには完全な形で収録されていない。今後は、複数のモデルと複数のランダムシードを用いた評価に加え、固定評価モデル自体の一貫性を監査する必要がある。

出典

  1. TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents
  2. TruthInsightBench repository