ホームへ戻る

AI 研究

AISI、推論計算量の評価をEvaluation Cardsに統合、レポート間の比較に向け設定を公開

AISIとEvalEvalは、既存研究の結果と設定を共通形式で整理した。対象は主実験の5つのベンチマークと関連するサイバーセキュリティ評価。予算やフィードバック条件の確認に役立つが、形式の検証は独立した再現実験を意味しない。

Robert Underwood · CC BY-SA 2.0 · Image source
zh-Hant

英国のAI Security Institute(AISI)とEvalEvalは9月22日、Evaluation Cardsを通じて評価結果、設定、研究の背景を整理し、公開すると発表した。対象はHealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0という主実験の5つのベンチマークと6つのモデルで、使用モデルが一部異なる2つのサイバーセキュリティ評価も含まれる。今回の進展は、データが共通の報告枠組みに組み込まれた点にある。関連論文はすでに6月に公開されている。[共同発表](https://huggingface.co/blog/evaleval-aisi)、[論文の公開履歴](https://arxiv.org/abs/2606.17930)。

基盤となるEvery Eval Ever(EEE)は、構造化された記録によってモデル、評価フレームワーク、生成パラメータ、スコアを関連付け、Inspect AI、HELM、lm-eval-harness向けの変換ツールを提供する。全体の結果はJSONに格納し、設問ごとのデータは共通の識別子を持つJSONLに別途保存する。記録では、単一ターン、複数ターン、ツールを使うエージェントのやり取りを区別できる。設問ごとのデータがそろっていれば、エンジニアはランキング上の単一の数値を読むだけでなく、入力、応答、ツール呼び出しを追跡できる。[EEEのリポジトリと形式の説明](https://github.com/evaleval/every_eval_ever)。

この整理方法は、推論予算と再試行のルールによって成績が変わるという、関連研究の中心的な問題に直接対応している。論文の主実験では、6つのモデルを5つのベンチマークで、それぞれ正誤フィードバックの有無という2条件で実行し、各タスク・各条件につき5本の独立した実行軌跡を取得した。さらに、トークン予算を増やし、コンテキストを圧縮し、繰り返しの提出を認めることで、計算資源の投入量に応じて能力がどう変化するかを調べた。[実験方法](https://arxiv.org/html/2606.17930v3)。

実行軌跡1本あたりの上限は、ベンチマークに応じて500万〜3,000万トークンとなる。計数には対象モデルの入力、出力、推論のトークンを含み、採点モデルのトークンは除外する。正誤フィードバックがある条件では、エージェントは提出が成功したかどうかを知ることができる。これは、必ずしも正解を入手できない実際のサービスとは異なる状況だ。そのため、読者はスコアと併せてフィードバック条件と総予算を確認する必要があり、累積成功率をそのまま1回の回答の正解率として扱うことはできない。[予算とフィードバックの定義](https://arxiv.org/html/2606.17930v3)。

社内評価プラットフォームを構築するチームにとって、EEEの価値は共通のデータインターフェースにある。既存の記録を変換すれば、モデル、ツール構成、予算で絞り込んで比較できる。これは公開されたアーキテクチャに対するエンジニアリング上の解釈である。形式の検証に合格しても、各フィールドが仕様に準拠していることを示すにすぎず、実験が独立に再実行されたことを意味しない。また、異なるフレームワーク間で採点の意味が同じであることも保証しない。[EEEのアーキテクチャ](https://github.com/evaleval/every_eval_ever)。

今回の発表が示しているのは既存の研究データをまとめた公開レポートであり、9月時点の最新モデルの能力ランキングではない。今後は、各結果に設問ごとの記録、モデルのバージョン、設定が漏れなく付属しているかを確認し、データセット、サンドボックス、採点器を入手できるかも確かめる必要がある。これらの条件をそろえられて初めて、機関をまたぐスコア比較に十分な根拠が得られる。

出典

  1. How UK AISI and EvalEval Are Making Benchmark Results Reproducible
  2. Every Eval Ever
  3. How Inference Compute Shapes Frontier LLM Evaluation
  4. How Inference Compute Shapes Frontier LLM Evaluation — v3
  5. Evaluation Cards