模型評測研究
BenchMIRT 以多維項目反應理論拆解 LLM 評測,揭露安全分數混入推理能力
Ai2 開源 BenchMIRT,從逾 3.4 萬道題目的模型作答模式中分離安全與一般推理等潛在能力。實驗顯示部分安全基準主要反映推理表現,精選一成題目亦能大致保留能力排序,但資料只涵蓋截至 2025 年初的模型。

Allen Institute for AI(Ai2)發布 BenchMIRT,以多維項目反應理論(multidimensional item response theory,MIRT)稽核 LLM 基準中的每一道題目。一般排行榜把所有題目壓成單一平均分,難以判斷模型究竟因安全拒答、知識不足或推理失誤而失分;BenchMIRT 則同時估計模型在潛在能力維度上的強弱,以及每道題目的難度和鑑別力。
研究輸入涵蓋 100 個開放權重模型、16 套基準與逾 3.4 萬道題目,其中包括 MMLU-Pro、GPQA、MATH、BBH,以及 HarmBench、StrongReject、WildJailbreak、BBQ、WMDP 和 XSTest。研究者未預先告訴系統各基準的分類,模型仍反覆恢復出兩個主要維度:一般推理與安全行為。這提供了一種資料驅動的校準方式,但不代表所有能力都天然只有兩維;潛在維度會隨輸入的基準集合改變。
分析發現,BBQ 雖通常被歸為社會偏見或安全評測,分數卻較強地跟一般推理能力連動。WMDP 也主要映射到推理維度,而且推理越強時分數可能越低,原因是該基準把拒絕提供危險知識視為正確。HarmBench 內部亦非單一訊號:一般與情境式有害要求偏向安全維度,著作權題目則較接近推理維度。這意味著工程團隊不宜把整套安全基準的總分直接解讀為單一防護能力。
BenchMIRT 還能按資訊量選題;團隊稱只保留約 10% 題目,通常仍可得到接近完整評測的能力圖像,並以 79% 準確率預測模型是否答對未觀測題目,高於簡單平均基線的 70%。不過,用隨機留出題目的整體排名作目標時,傳統平均分略勝。更重要的是,樣本模型皆在 2025 年3月前發布,結論尚未驗證於新一代推理模型;選題工具也可能被反向用來移除最具鑑別力的安全題。