返回首頁

模型評測

Artificial Analysis Index 4.2 將私有測試權重倍增至 40%,並撤下已飽和的 GPQA Diamond

新版指數加入代理知識工作與長篇 PDF 推理測試,把不公開題目的權重由 20%提高至 40%。這能降低針對公開題庫最佳化的空間,卻也使外部研究者更難完整重現排名。

Member of the Expedition 22 crew. · Public domain · Image source
zh-Hant

Artificial Analysis 於 9 月 4 日更新 Intelligence Index 至 4.2,重新界定其綜合分數所衡量的能力。新版加入 AA-Briefcase:模型必須處理由業界專家設計、包含多個相互依賴任務及數千份來源檔案的長週期知識工作專案,結果同時接受規準評分與成對比較。它不只檢查最終答案,也評估可驗證的任務完成度、分析品質與呈現品質。

另一項新增測試 GDP.pdf 聚焦單回合專業文件推理。題目橫跨十個領域、100 份 PDF 與 4,592 頁內容,要求模型整合正文、表格、圖表、註腳和排除條件;答案依 1,275 項專家撰寫的原子規準評分,只有滿足全部相關規準才計入 headline All-pass Rate。相對地,GPQA Diamond 因頂尖模型成績逐漸飽和而被移出指數。AA-LCR 的答案鍵與評分提示、SciCode 的執行沙箱,以及部分 Elo 取樣和錨定方式也同步調整。

最具方法學影響的改動,是私有、留出測試在總分中的權重由 20%升至 40%,涵蓋 AA-Briefcase、AA-Omniscience 與 CritPt 解答。這能減少模型供應商直接針對已公開題目訓練或調參的誘因,也讓排行榜更接近未知工作負載;代價則是外部研究者無法獨立檢查題目分布、資料污染及評審誤差。換言之,抗作弊性提高,但透明度與可重現性下降。

重算後 Claude Fable 5.1 居綜合榜首,GPT-6 Astra 第二;後者在 GDP.pdf 得到 33.2%,高於 GPT-5.6 Sol 的 28.2%及 Fable 5.1 的 26.2%。這些名次不應直接與舊版分數作時間序列比較,因為題組、權重和評分器均已改變。採購或路由系統若把單一 Index 分數設為閘門,應固定版本並保留分項指標;接下來要看 v5 是否進一步提高私有測試比例,以及測試營運方如何交代輪替、洩漏偵測與跨版本校準。

來源

  1. Announcing Artificial Analysis Intelligence Index v4.2
  2. Artificial Analysis v4.2 Doubles Private Test Weight to 40%