返回首頁

AI 安全/多模態模型

僅反傳視覺編碼器即可攻擊 VLM,H100 生成時間由逾 20 分鐘降至約 100 秒

新研究毋須對完整多模態模型反向傳播,只調整輸入影像,使視覺編碼器的表示偏離原圖或逼近指定目標。四款開放 VLM 的非定向攻擊成功率均逾 93%,但評分依賴單一 LLM 裁判,且尚未測試黑箱轉移能力。

Hans A. Rosbach · CC BY-SA 3.0 · Image source
zh-Hant

一項 8 月 19 日提交的研究,把視覺語言模型攻擊的計算範圍縮至視覺編碼器。定向攻擊先取得目標影像的向量,再以 50 輪 I-FGSM 更新原圖像素,最小化對抗影像與目標向量的均方誤差;非定向版本則最大化對抗影像與原圖向量的距離。梯度不必穿過語言模型及完整生成路徑,因而減少記憶體與運算需求。

研究以 ImageNet 的 1,000 組隨機影像測試 Qwen2.5-VL-3B、Granite Vision 3.2 2B、FastVLM 7B 及 Phi-3.5 Vision。當擾動上限 ε=0.05,非定向攻擊成功率介乎 93.0% 至 99.8%;定向結果差異較大,Granite 達 41.15%,Phi-3.5 僅 2.0%。ε 提高至 0.20 後,Granite、FastVLM 與 Qwen 分別約為 45.91%、29.5% 與 25.0%。這顯示破壞語義通常遠比把輸出導向指定內容容易,也顯示不同視覺編碼器的脆弱程度不能由一般影像理解分數直接推斷。

系統量測同樣值得注意:在 H100 80GB 上,完整 VLM 反傳約使用 44% 至 47% 顯存,僅反傳編碼器則降至 13% 至 16%。Qwen 的完整路徑運行逾 20 分鐘仍未成功,編碼器路徑約 100 秒完成。對部署工程師而言,影像完整性檢查、輸入壓縮或隨機化,以及編碼器級壓力測試應納入 VLM 安全評估。

不過,論文以 Granite-4.0-micro 比較一行影像描述,成功率可能混入裁判偏差;ε 的可察覺程度也缺少正式人評。攻擊需要模型梯度及針對各架構調整特徵層,尚未證明能跨模型轉移、攻擊封閉 API,或在真實相機與再編碼流程後存活。

來源

  1. Breaking the weakest link to evade vision language models
  2. Qwen2.5-VL-3B-Instruct model card
  3. Granite Vision 3.2 2B model card