AI 評測與科學研究
AI科学者の先行評価にレースカーとデッキを活用、GPT-5.2の166件のアイデアで実際のイノベーションに合致したのは10件
新たな評価手法では、まずモデルのアイデアを封印し、その後に登場するシーズン中の技術やプロ大会のデッキを遅延正解として使用することで、過去を振り返るベンチマークに伴うデータ汚染の懸念を軽減した。結果から、モデルにはもっともらしいアイデアが不足しているのではなく、真に有用な新規性を選別・組み合わせ・識別する能力がボトルネックであることが示された。

「AI科学者」が新たな発見を提案できるかを評価する際には、通常、標準的な正解が存在しないこと、検証に長期間を要すること、モデルが過去の成果を学習済みである可能性などが問題となる。8月4日にアップロードされた新たな研究では、将来を見据え、正解を遅れて開示する実世界評価を採用した。研究者らはモデルに、2026年のFormula 1(F1)新レギュレーションに基づくレースカー設計のアイデアを提案させ、その後、プレシーズンに実車で確認された40件のイノベーションと照合した。別の実験では、『Magic: The Gathering』のカードプール更新後にデッキを生成し、プロツアーのデッキリスト19件と比較した。これにより、競合者が独立して生み出した公開成果が、事後的に観測可能な正解となった。
F1実験では6種類のモデルを評価した。最も高い成績を収めたGPT-5.2は、複数回の実行で166件のアイデアを提案し、実際の40件のイノベーションのうち10件に合致した。生成数で正規化すると、アイデア100件当たりの合致数は6件だった。全モデルを合計すると、ルールに適合すると判定されたアイデアの19.4%が実際のイノベーションに対応し、明確にルール違反だったものはわずか0.9%だった。これは、ルールチェックによって探索空間を狭められる一方、最も価値の高い案を特定するには不十分であることを示している。当初LLMが潜在的な対応関係として抽出した519組のうち、人的レビュー後に89%が「不一致」へ格下げされた。この結果は、意味的類似度が表面的な重なりを同一のメカニズムと誤認しやすいことも浮き彫りにした。
デッキ実験では合計108個のデッキが生成された。Gemini 3 Flashの最良の単一デッキは、3位入賞デッキに含まれていた新カード7枚のうち5枚を再現した。注目すべきことに、ツールを追加するとメインデッキの合法率は大幅に改善し、例えばGPT-5.2では11%から100%へ上昇した。しかし、すべてのモデルで新カードの発見率は逆に低下した。これは、ツールフレームワークが制約遵守を強化する一方で、探索範囲を狭める可能性を示している。最終的に、両分野はあくまで科学的発見の代理タスクであり、人間が考案した解決策との一致も、モデルがそれを独立して導出したことを意味しない。それでも、コード、プロンプト、出力、データは公開されており、研究者が時間的カットオフ、評価者バイアス、さらには同じ手法をシミュレーターや実験による検証が可能な科学課題へ応用できるかを詳しく検証する価値がある。