AI 安全
七種簡單影像變換可繞過三款商用 AI 內容審核服務
黑箱實驗發現,反相、灰階等不需梯度或替代模型的低成本變換,就能使三款商用服務把仍可辨識的有害影像改判為安全。多模態內容與自殘類別尤其脆弱,顯示基礎模型審核 API 不宜被當成單一安全邊界。

商用內容審核服務正從專用分類器轉向多模態基礎模型,但更廣的語意理解並不自動帶來更強的對抗韌性。7 月 30 日提交的新研究以黑箱方式測試三款既有商用影像審核服務,對多個資料集與危害類別施加七種通用影像變換。攻擊者不需要模型權重、梯度、查詢訓練出的替代模型或針對供應商設計的擾動,只需改變輸入影像,即可觀察 unsafe-to-safe 的決策翻轉。
值得注意的是,成功變換不全是人眼難以察覺的微小雜訊。固定的色彩反相與灰階轉換也會讓三項服務漏判,而影像內容仍可由人辨識;研究同時以感知相似度限制與不同變換強度檢查結果,並發現韌性會隨資料集、危害類別及服務而顯著變動。多模態內容與自殘影像呈現較明顯弱點,說明審核模型可能依賴顏色分布、局部紋理或資料集捷徑,而沒有形成對語意危害穩定的表示。
這項結果對 API 使用方式的影響大於對單一模型架構的排名。若上傳、社群或生成平台把一次審核回應直接當作准入閘門,攻擊者便能離線產生大量便宜變體,逐步尋找可通過的版本。較穩健的管線應結合檔案與來源信號、影像正規化、多尺度或多視圖檢查、專用分類器、文字與 OCR 分支、重複內容雜湊,以及對高風險類別的人工升級流程;同時應記錄模型與政策版本,建立涵蓋常見編輯操作的回歸測試。
限制是這仍屬供應商 API 的時間點黑箱測量:服務端模型、閾值與政策可能在未公告下更新,論文也不能指出內部失效機制。工程團隊接下來應關注作者是否公開完整查詢集與重現程式,以及供應商能否在固定版本、查詢成本與誤報率相同的條件下重現防禦效果。