ホームへ戻る

AI 評測

動的予測ランキングが専用エージェントの優位性を示す:フロンティア汎用モデルはForecastBenchを独占せず

ForecastBenchが7月27日に更新した暫定ランキングでは、上位3位をTorchcast AIの専用エージェントが独占し、最高Brier Indexは65.6だった。GPT-5.5検索エージェントとスーパーフォーキャスターの中央値は近い水準にあるが、問題数、提出時期、信頼区間の違いにより、順位の単純な比較には限界がある。

U.S. Air Force photo by Airman Hannah Bench · Public domain · Image source
zh-Hant

ForecastBenchの最新の暫定ランキングは、知識テストやプログラミング評価とは異なるシグナルを示している。7月27日時点で、Torchcast AIの`rice-demon`、`captain-jack`、`dragon-brother`が上位3位を占め、Brier Indexはそれぞれ65.6、65.3、65.2だった。Google DeepMind、Voicetree、GPT-5.5検索エージェント、FutureSearchのシステムがそれに続く。この結果は、小規模チームが汎用人工知能の面でフロンティアモデルを上回ったことを意味するものではない。むしろ、検索、確率キャリブレーション、問題分解、アンサンブル戦略が、単一の基盤モデル名以上に予測品質を左右し得ることを示している。

このベンチマークでは、システムに対して2週間ごとに、まだ結果が判明していない現実世界の事象を予測するよう求める。そのため、提出時点では正解が存在せず、学習データによる汚染の影響を受けにくい。元のBrier scoreは問題の難易度に応じて調整された後、0~100のBrier Indexに変換される。50は情報をまったく持たない予測を表し、数値が高いほど優れている。FutureSearchが併せてまとめたpreliminary leaderboardには304件の提出が含まれており、GPT-5.5の高推論設定とWeb検索を組み合わせたシステムは63.8を記録したが、完了したのは242問にとどまる。一方、上位3システムはそれぞれ479問を完了している。スーパーフォーキャスターの中央値は63.7だが、異なる時期に実施された521問に基づくため、厳密な同条件比較とはみなせない。

エンジニアリング上の重要な点として、ForecastBenchの正式ランキングでは、安定性を高めるために提出結果の反映を遅らせている。現在の画面にはpreliminaryであることが明記されている。また、各システムの信頼区間は大きく重なっており、0点数ポイントの差に統計的な意味があるとは限らない。今後は、専用エージェントがより多くのラウンドでも首位を維持できるかを見極める必要がある。また、検索ログ、プロンプト、アンサンブル手法、コストが公開されなければ、ランキングから分かるのはシステム全体が有効だということだけであり、性能向上がモデル、データソース、後処理のいずれに由来するのかを特定することはできない。

出典

  1. FutureSearch Evals
  2. ForecastBench Leaderboards
  3. ForecastBench project overview