返回首頁

AI 安全

MissClick 利用座標 token 位值攻擊 GUI 代理,定向誤點成功率最高達 62.67%

MissClick 不把 GUI 座標視為一般文字,而是利用百位數 token 的微小變動造成大幅點擊位移。研究在 OS-Atlas 與 UGround 上顯著提高攻擊成功率,顯示電腦操作代理不能只靠元素定位準確率評估安全性。

UpstateNYer · CC BY-SA 3.0 · Image source
zh-Hant

GUI 代理通常讓視覺語言模型輸出 `(x, y)` 座標,再由執行器轉成真實滑鼠或觸控事件。MissClick 指出,這個看似單純的序列化介面形成特殊攻擊面:模型逐 token 預測十進位數字,但解析器依位值還原座標;百位數只改變一個 token,實際點擊位置就可能偏移 100 個正規化單位,遠大於一般文字 token 變動的語義影響。

研究分別設計兩種白箱影像擾動。MissClick-U 以可微分的「軟座標」最大化預測點與正確區域的距離,目標是讓代理點到元素之外;MissClick-T 則按十進位位值加權目標數字的 loss,把點擊導向攻擊者指定區域。後者意味著攻擊不只可讓任務失敗,也可能把「確認」改成「刪除」、把一般連結改成授權或付款元件。

作者在桌面、網頁與行動介面上測試 OS-Atlas 與 UGround。MissClick-U 的非定向成功率分別為 75.07% 與 72.93%,較既有攻擊提高 16.62 與 30.72 個百分點;MissClick-T 的定向成功率為 44.86% 與 62.67%,提升 31.73 與 47.06 個百分點。OS-Atlas 的公開實作會把座標正規化至 0–1000,正好展示位值誤差如何被映射回原始畫面。

這項結果對瀏覽器及桌面代理的防護有直接含義:輸出通過 JSON schema 或座標範圍檢查,不代表動作安全。執行層應重新以畫面元素邊界驗證座標,對敏感元件加入語義確認,並限制單張受擾畫面直接觸發不可逆操作。限制是 MissClick 假設白箱存取模型梯度,尚未證明相同成功率能透過遠端 API、截圖壓縮或未知模型轉移;論文也未附公開攻擊程式碼,因此數字仍待第三方驗證。

來源

  1. MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models
  2. OS-Atlas: A Foundation Action Model for Generalist GUI Agents
  3. UGround: Universal GUI Visual Grounding for GUI Agents