返回首頁

AI 安全與評測

UNLINK-VL 揭露多模態遺忘落差:文字刪除難以阻止模型從圖片找回知識

新基準以可視辨識的真實實體測試視覺語言模型,發現只用文字做知識遺忘,效果不易轉移至圖片與跨模態問答。多模態遺忘可回頭通過文字測試,顯示單一文字評測可能高估刪除成效。

zh-Hant

對大型模型執行「機器遺忘」時,研究者常以文字提示確認特定人物、物件或事實是否已被刪除;但視覺語言模型可能仍能看圖辨識同一實體,再由視覺表徵重建相關知識。8 月 4 日提交的 UNLINK-VL,正是要量化這個跨模態漏洞。

基準採用 post-hoc 設定,假設操作者拿不到原始的 forget 與 retain 訓練語料。研究團隊挑選具有可辨識外觀的真實實體,配對圖片及由 Wikidata 關係建立的一跳、多跳事實,再分成四類測試:直接忘記目標、遺忘是否沿關係傳播、相關但不該刪除的知識能否保留,以及模型面對語意等價問法時是否仍會洩漏。這比只問一次「你知道某人嗎」更接近刪除要求的實際驗收。

作者分別以純文字和多模態資料執行遺忘,再從文字、視覺及跨模態三條路徑評估。主要結果呈現明顯不對稱:多模態遺忘在文字評測中仍有效,純文字遺忘卻難以轉移至圖片與跨模態情境。換句話說,模型可能在文字介面拒答或忘記某項知識,看到相關圖片後仍重新識別並回答;只公布文字遺忘率因此不足以證明資料已從整個模型行為中移除。

這對著作權移除、個資刪除與有害知識治理都有直接影響:驗收矩陣必須涵蓋輸入模態、關係推理及改寫攻擊,而非單一 benchmark 分數。不過,論文目前只證明受測模型與方法存在這種落差,不能推論所有 VLM 都同樣失敗;真實實體與 Wikidata 關係也可能帶入知名度、圖片品質及知識圖譜覆蓋偏差。後續應觀察資料與程式是否完整公開、能否加入影音和 OCR 路徑,以及遺忘效果在模型微調或更新後是否反彈。

來源

  1. Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation
  2. Wikidata: Introduction