代理評測
Terminal-Bench-Science 0.1、70件の実践的な科学研究ワークフローでエージェントを評価、最高解決率はわずか30%
Stanford主導のオープンベンチマークは、データ分析、シミュレーション、定理証明、機器校正などの科学研究を再実行可能なターミナルタスクとしてパッケージ化した。Claude Codeと組み合わせたClaude Opus 5が首位となったが、3回の試行後も解決率は30%にとどまり、一般的なcoding benchmarkでの高得点を科学研究へそのまま外挿できないことを示している。