AI 安全
MIND 以意圖資訊瓶頸過濾代理記憶,攻擊成功率平均降低逾 55%
MIND 不再逐條呼叫大型模型審核記憶,而是比較原始意圖與後續行為的壓縮表示,再用多超平面分類器攔截中毒內容。四款模型的受控實驗顯示攻擊成功率下降、平均延遲接近無防禦基線,但程式碼尚未公開。

具持久記憶的代理會把過往對話或工具結果寫入向量庫,再於後續任務檢索;攻擊者因此可植入看似相關的紀錄,讓客服代理繞過退款驗證,或把推理導向預設答案。7 月 30 日提交的 MIND 將防禦問題改寫成「初始意圖是否與目前行為偏離」,避免每回合使用另一個 LLM 審核完整軌跡。
系統先從凍結的 Llama-3.1-8B-Instruct 取得初始請求與逐回合行為的隱藏表示,再以變分資訊瓶頸壓縮重複、與任務無關的訊號,同時用監督式對齊把正常回合拉近意圖錨點、把中毒回合推遠。最後的多超平面分類器為不同攻擊型態建立分段邊界;推論時會分別檢查每回合檢索到的前五筆記憶。
研究以 AgentPoison 與 MINJA 生成攻擊,在 StrategyQA、MMLU 及 EHR/問答軌跡上測試 DeepSeek-V4、GPT-4o-mini、Llama-3.1-8B-Instruct 與 Qwen3-8B-Instruct。ReAct-StrategyQA 的平均檢索層與代理推理層攻擊成功率相對無防禦配置下降 55.4% 與 55.3%,任務準確率為 67.95%,無防禦基線則為 67.56%;平均每回合時間為 23.13 秒,也接近基線的 23.36 秒。
工程上的價值是把記憶防火牆從高成本生成式審核器改成可重複執行的判別模組。不過這仍是已知攻擊、受控資料與固定 top-5 檢索設定下的三次實驗;特徵抽取仍需一個 8B 模型,且論文未提供程式碼。後續應觀察跨語言、全新注入策略、記憶長期漂移,以及誤擋合法意圖變更時的恢復機制。