返回首頁

多模態評測

ERUnderstand 將 ER 圖轉成結構化測試,VLM 在多元關係與弱實體上明顯失準

ERUnderstand 收集與生成 2,960 張實體關係圖,要求視覺語言模型輸出可逐欄位比對的 JSON schema。模型能辨識常見實體與屬性,卻常依文字語意及空間鄰近猜測連線,複雜 EER 結構的 F1 最低僅 0.07。

Chatham House · CC BY 2.0 · Image source
zh-Hant

ERUnderstand 把資料庫工程中常見、卻未被主流多模態評測充分涵蓋的任務正式基準化:從 ER/EER 圖片還原機器可讀的資料模型。資料集包含 2,960 張圖、17,415 個實體、15,305 條關係及 66,856 個屬性,來源分為教育材料、Spider、BIRD、Northwind 等實際 schema,以及以 LLM 輔助 Graphviz 管線生成的受控樣本。每張圖都配有統一 JSON,記錄主鍵、基數、弱實體、繼承、多值與複合屬性等元素,因而可評估結構是否真的還原,而不只是回答圖片問題。

十款受測視覺語言模型對基本元素已有不錯辨識能力,常見實體、關係或屬性的 F1 可超過 0.74;進入細粒度符號後卻快速下降。論文摘要報告弱實體最低 0.28、多值屬性 0.14、三元以上關係 0.07。更細的分析顯示,非推理模型在 N-ary 關係上低於 0.01 F1,推理模型雖可提高至約 0.31,仍不足以直接產生可信 schema。推理增強整體帶來約 15% 至 25% 改善,但沒有消除拓撲錯誤。

錯誤型態對工程應用尤其重要。模型容易替圖上相鄰、語意看似合理的實體虛構關係,也會漏掉距離較遠但確實有線連接的節點。研究者把標籤換成隨機字串或打亂角色後,各模型成績普遍下滑,說明它們部分依靠「ID 通常是主鍵」之類語言先驗,而非穩定讀取底線、雙框、虛線及連接拓撲。互動式自我檢查能減少漏項,卻較難修正底層視覺結構推理。

資料集與評測程式已在 GitHub 公開,可用於測試資料庫 copilot、舊系統遷移或文件解析管線。不過,人工標註的獨立雙標註試驗只涵蓋 30 張圖,平均一致性為 89.72%;評測也採單一提示、零溫度,且未與傳統 OCR、形狀偵測和圖追蹤管線比較。工程團隊因此仍應把 VLM 輸出視為候選 schema,搭配語法驗證、連線追蹤與人工審查。

來源

  1. ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams
  2. ERUnderstand Benchmark and Evaluation Toolkit