返回首頁

AI 研究

AISI 將推論算力評測接入 Evaluation Cards,公開設定供跨報告比較

AISI 與 EvalEval 以共同格式整理既有研究的結果與設定,涵蓋五項主實驗基準及相關資安評測。資料有助追查預算與回饋條件,但格式驗證不等於獨立重現。

Robert Underwood · CC BY-SA 2.0 · Image source
zh-Hant

英國 AI Security Institute(AISI)與 EvalEval 於 9 月 22 日宣布,透過 Evaluation Cards 公開整理評測結果、設定與研究脈絡。此次涵蓋 HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0 五項主實驗基準及六個模型,另附兩項使用部分不同模型的資安評測。新進展是資料進入共同報告架構;相關論文已於六月公開。[合作公告](https://huggingface.co/blog/evaleval-aisi)、[論文發布紀錄](https://arxiv.org/abs/2606.17930)。

底層 Every Eval Ever(EEE)以結構化紀錄連結模型、評測框架、生成參數與分數,並提供 Inspect AI、HELM、lm-eval-harness 的轉換器。整體結果放在 JSON,逐題資料另存共用識別碼的 JSONL;紀錄可區分單輪、多輪及工具代理互動。若逐題資料齊備,工程師便能追查輸入、回覆與工具呼叫,而不只讀取榜單上的單一數字。[EEE 程式庫與格式說明](https://github.com/evaleval/every_eval_ever)。

這種整理方式直接回應相關研究的核心問題:推論預算與重試規則會改變成績。論文主實驗讓六個模型在五項基準下,各以有、無正確性回饋兩種條件執行,每個任務與條件取五條獨立軌跡;同時增加 token 預算、壓縮上下文並允許重複提交,以觀察能力隨計算投入如何變化。[實驗方法](https://arxiv.org/html/2606.17930v3)。

其每條軌跡上限依基準介於五百萬至三千萬 token,計數包含目標模型的輸入、輸出與推理,排除評分模型的 token。提供正確性回饋時,代理可得知提交是否成功,這與真實服務未必拿得到標準答案的情境不同。因此,讀者需要把回饋條件及總預算放在分數旁,不能直接把累積成功率當成單次回答準確率。[預算與回饋定義](https://arxiv.org/html/2606.17930v3)。

對建立內部評測平台的團隊,EEE 的價值在於共用資料介面:轉換既有紀錄後,可按模型、工具配置與預算篩選比較。這是對公開架構的工程解讀;格式通過驗證只代表欄位符合規格,不等於實驗已被獨立重跑,也不保證不同框架的評分語意相同。[EEE 架構](https://github.com/evaleval/every_eval_ever)。

目前公告指向既有研究資料的公開報告,並非九月最新模型的能力排名。後續值得核對各筆結果是否附齊逐題紀錄、模型版本與設定,並確認資料集、沙箱及評分器能否取得。只有這些條件可對齊,跨機構分數比較才有足夠依據。

來源

  1. How UK AISI and EvalEval Are Making Benchmark Results Reproducible
  2. Every Eval Ever
  3. How Inference Compute Shapes Frontier LLM Evaluation
  4. How Inference Compute Shapes Frontier LLM Evaluation — v3
  5. Evaluation Cards