返回首頁

AI 安全

MAFIA 以查詢探測污染代理長期記憶,攻擊成功率最高達 90.7%

MAFIA 先探測記憶檢索器的偏好,再以簡短事實包裝惡意指令,使污染紀錄更容易被代理取回。研究自報可把稽核偵測率壓至最多 7.4%,但公開儲存庫目前仍只有預告頁面。

Alexnevzorov · Public domain · Image source
zh-Hant

長期運作的 LLM 代理會把對話、工具結果與任務經驗寫入外部記憶,之後再以向量或混合檢索取回。這讓攻擊者不必修改模型或取得記憶資料庫權限:只要能提交會被保存的查詢或內容,就可能讓惡意紀錄在未來任務中反覆影響代理。

8 月 4 日提交的 MAFIA 將問題設定得更接近實際部署。大型記憶池中,單純塞入提示注入文字通常會被大量正常紀錄淹沒;語意稽核器也可能在寫入前攔截明顯的操控指令。MAFIA 因此先透過查詢回應探測檢索行為,估計哪些措辭與寫入時機較容易取得高排名,再依攻擊預算安排多筆紀錄。其 payload 則把操控目標壓縮成看似正常的「事實」,維持與目標查詢的語意相似度,同時降低被輸入稽核器辨識的機率。

論文自報,在所測代理記憶系統上,MAFIA 的攻擊成功率最高為 90.7%;原本最高可達 83.3% 的稽核偵測率,面對事實式包裝後降至最多 7.4%。這意味著只在寫入端部署內容分類器並不足夠,因為攻擊同時利用檢索排序、跨時間累積與模型對「已知事實」的信任。

工程上應把記憶視為具來源與權限的資料庫,而非無害的上下文快取。可觀察方向包括:限制低信任來源的持久化、保存 provenance、對高影響記憶要求多次獨立證據、監測相似紀錄的集中寫入,並在執行敏感工具前重新驗證取回內容。主要限制是所有數字均來自作者實驗;論文雖連結 GitHub,但截至查核時儲存庫只寫著程式碼準備中,尚不能獨立重現攻擊或確認防禦設定是否公平。

來源

  1. MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents
  2. MAFIA official repository