多模態評測/AI 安全
SHROOM-Visions 以 2 萬筆四語資料評測 VLM 幻覺,中文最佳 IoU 仍僅 0.53
新共享任務要求系統逐字定位並分類視覺語言模型的幻覺,而非只判斷整段回答是否可信。27 個團隊提交逾 600 個系統,但封閉測試與不穩定的相鄰排名限制了結論。

SHROOM-Visions 2026 公布完整共享任務結果,把視覺語言模型(VLM)的幻覺偵測拆成更細的字元級問題。每筆資料包含圖片、提示詞、模型輸出、幻覺文字範圍及類別;參賽系統必須為輸出的每個字元估計「屬於幻覺」的機率,再把範圍標成虛構物件、錯誤描述、OCR 誤讀、數量錯誤或其他類型。
資料集共約 20,000 筆,涵蓋中文、英文、法文及義大利文。訓練集約 15,200 筆,來自五種不同 VLM 的輸出;封閉測試集為 4,800 筆,每種語言 1,200 筆。評分不只計算預測與人工標註範圍的字元交集聯集比(IoU),也量度幻覺機率與多位標註者經驗機率的相關性,以及納入類別是否正確的 correlation。這種設計能區分「知道回答有問題」與「精確找出哪幾個字、屬於哪一種錯誤」。
27 個團隊合計提交逾 600 個系統。跨四語最佳結果平均取得 0.58 字元相關性、0.46 類別條件相關性及 0.51 IoU,較官方 baseline 高約 30 至 40 個百分點。中文由 vroom-vroom 領先,相關性約 0.61、IoU 約 0.53;英文則由 TÜRKSAT 取得約 0.55 相關性與 0.49 IoU。即使最佳系統,仍有接近一半的幻覺範圍無法與人工標註重合,顯示這類 detector 尚不適合直接充當可靠的輸出閘門。
論文亦以 25,000 次 bootstrap 檢查排名,發現多組相鄰頂尖系統的穩定勝出機率只有約 0.35 至 0.47,細微名次不應視為確定優劣。工程上更值得比較的是各語言、錯誤類別、校準度及標註策略下的失敗模式。後續應關注測試資料是否公開、參賽方法能否重現,以及 detector 面對新一代 VLM、長回答與真實文件圖片時是否仍能維持校準。