返回首頁

AI 安全與代理框架

SHE 從代理執行軌跡改寫安全外殼,攻擊成功率由 17.1% 降至 5.5%

SHE 把代理安全外殼拆成系統提示、規則庫、安全記憶與工具政策,再依失敗軌跡局部修訂。它在 Agent-SafetyBench 同時降低攻擊成功率與誤拒率,但真實部署仍須防範評分器偏差及規則自我膨脹。

Bernd Uhlig, Deutsche Oper Berlin · CC BY-SA 4.0 · Image source
zh-Hant

上海人工智慧實驗室、復旦等機構提出 Safety Harness Evolution(SHE),把代理安全從固定的系統提示,改造成可由歷史執行軌跡持續修訂的非參數層。框架保持底層模型與任務環境不變,將外殼拆成四項責任明確的產物:系統提示負責整體信任邊界;規則庫分類風險並決定允許、警告、封鎖或清理;安全記憶保存反覆無法修復的案例;工具政策限制呼叫權限及被阻擋後的恢復流程。

每輪演化先重播乾淨與對抗任務,依危害領域、攻擊面及失敗模式產生結構化診斷,再把問題路由到最小的責任產物。候選修改必須通過格式與合理性檢查,而且只有在安全分數提高、正常任務效用不下降時才會取代現行版本;遭拒修改及原因則留給下一輪參考。這種設計試圖避免代理只靠擴張禁止規則來「刷高」安全分數。

研究以 Agent-SafetyBench 的 15 項任務演化外殼,再在其餘 185 個任務 ID 上測試乾淨輸入、上下文污染、間接提示注入、工具竄改、記憶注入及複合攻擊。演化後 SHE 的平均攻擊成功率為 5.5%,低於靜態 SafeHarness 的 17.1%;可用性準確率由 31.6% 提高至 47.6%。若只比較 SHE 演化前後,攻擊成功率由 8.6% 降至 5.5%,乾淨請求的不當封鎖率亦由 25.7% 降至 19.8%。在未參與演化的 AgentHarm,Harm Score 由 19.8% 降至 9.8%。

程式、固定資料切分及外殼種子已用 Apache-2.0 授權公開,但生成後的外殼、完整 rollout、憑證與外部基準套件並未隨庫提供。工程團隊因此可檢查演化流程,卻仍須自行支付模型與評分成本才能重跑主要結果。下一步應觀察長期更新是否造成規則衝突、評分器過度擬合,以及自動生成的工具政策能否在實際權限系統中接受人工稽核與回滾。

來源

  1. SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
  2. RainbowQTT/SHE