返回首頁

多模態評測

PerceptionBench 將視覺推理拆回十項基本感知,16 款多模態模型無一達 60%

Moonshot AI 從 42 個既有基準的最早失敗點建立感知分類,再以 3,000 道短答案題隔離十項基本視覺能力。結果顯示整體分數相近的模型可能具有完全不同的感知缺口,但測試集源自更大的內部題庫,仍需防範污染與評測者偏差。

Bert Niehaus · CC BY-SA 4.0 · Image source
zh-Hant

多模態基準經常把看圖、背景知識與多步推理綁在同一道題目中;模型答錯時,開發者難以判斷問題出在視覺編碼器、座標定位,還是語言推理。Moonshot AI 公開的 [PerceptionBench 論文](https://arxiv.org/abs/2607.24957) 改從錯誤鏈的最前端切入:研究團隊分析模型在 42 個既有基準上的首個失敗點,整理出十類原子感知能力,再為每題配置短而明確的答案,盡量排除外部知識與複雜推理。

公開資料共 3,000 題,其中 1,800 題來自既有失敗案例的原子化子問題,另有 1,200 題使用補充影像重新撰寫。題目涵蓋文字辨識、物體與屬性、空間位置、數量、姿態及細粒度視覺差異等能力,並按類別與難度分層取樣。這種設計的價值不是再產生一個總排行榜,而是輸出能力剖面:兩款總分接近的模型,可能分別敗在小字辨識與空間定位,所需的資料修補和架構調整並不相同。

團隊以統一提示及各模型可用的最高推理預算測試十款閉源與六款開放模型;沒有模型達到 60% 正確率,而與感知型幻覺相關的項目平均最弱。這意味著延長思考或加入 chain-of-thought 未必能修復輸入端沒有可靠抽取的訊號,甚至可能把錯誤觀察包裝成更流暢的解釋。

完整題目、統計與排行榜已在 [Hugging Face 資料集](https://huggingface.co/datasets/moonshotai/PerceptionBench) 公開,官方亦提供 [技術介紹與下載入口](https://www.kimi.com/tr/blog/perception-bench)。工程團隊可將十類能力當成回歸測試切片,而非只追逐平均分。不過,公開的 3,000 題是從逾 17,000 題內部池抽樣,題目驗證流程與人類基線仍需進一步檢查;模型曝光於公開測試集後,後續版本的分數也可能受到訓練污染。

來源

  1. PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models
  2. moonshotai/PerceptionBench
  3. PerceptionBench: Evaluating Atomic Visual Perception in MLLMs