返回首頁

多模態評測

SciFigBench:GPT-5.2 圖表描述分數最高,面對不可讀內容卻有 96%仍作答

SciFigBench 用逾 34,000 組科學圖表測試,把看懂圖像與承認證據不足分開評量。GPT-5.2 的描述品質領先,Gemini 3.1 Pro 則更常拒絕從模糊或誤導證據下結論。

Internet Archive Book Images · No restrictions · Image source
zh-Hant

科學圖表評測通常只問模型能否讀出趨勢或回答問題,答對率卻無法反映模型在圖像模糊、資訊缺失或文字提示誤導時是否會停止猜測。SciFigBench 因此把「看得準」與「不確定時行為可靠」拆開,收集 250 張經高品質人工標註的科學圖表,投入逾 600 小時標註,再加入圖像轉換、推理問題、抗誤導探針、caption bias 探針及經確認的選擇性模糊區域,形成超過 34,000 組測試設定。

評測以 A-R-I 框架量度三件事:Admittance 檢查模型是否承認證據不足,Resistance 測試它能否抵抗錯誤上下文,Inductance 則觀察模型會不會從局部資訊過度推論。結果顯示,一般能力分數與行為可靠度並不等價。GPT-5.2 的描述品質 MQM 為 91.6、推理準確率為 78.4%,但在內容不可讀的案例中仍有 96%生成具體答案。Gemini 3.1 Pro 的 MQM 為 90.2、推理準確率為 81.0%,卻在 71%的不可讀案例承認不確定,抗誤導分數亦以 0.91居首。

這對論文閱讀代理、實驗資料抽取及醫學或工程報告管線尤其重要:若系統只用正常圖像準確率選模,可能部署一個善於描述、卻會在證據消失後繼續補寫數值的模型。工程端應把模糊、裁切、caption 衝突與拒答校準納入回歸測試,並要求輸出指向可見區域。限制是資料集只有 250 張原始圖表,逾 34,000 組設定多由同一批圖像衍生;排行榜也可能受提示模板、模型版本與供應商後端更新影響。

來源

  1. How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures
  2. SciFig-Eval Dashboard