返回首頁

AI safety research

LoopHarness 保留跨迭代風險狀態,五類代理攻擊的整體 ASR 降至 0.1%

新研究指出,逐軌跡重設的 guardrail 無法辨識被拆散到多次迭代的攻擊證據,單純讓風險分數隨時間衰減亦可被等待繞過。LoopHarness 在作者控制的 1,000 個攻擊 episode 中保留 96.9% 乾淨任務完成率,但結果尚待獨立重現與真實系統驗證。

William Felton · Public domain · Image source
zh-Hant

8 月 27 日上線的研究把代理安全邊界從單次 trajectory 擴展到整個自主迴圈。作者觀察到,許多防護會在每次任務開始時重設違規視窗、權限 token、檢查層級與回滾點;攻擊者卻能透過工作佇列、工具輸出或持久記憶累積進度。若惡意證據被切成多個局部看似正常的片段,任何只看單一 trajectory 的監視器都缺少完成判斷所需的聯合訊號。

論文提出 LoopHarness,包在既有單次軌跡防護之外,持續保存五類狀態:工作來源與權限檢查、跨迭代風險累積值、具完整性驗證的記憶、獨立停止仲裁器,以及限制高風險不可逆操作的 governor。關鍵設計是當結構性攻擊證據出現後,風險值不再因沒有新證據而自動衰減;計數器、能力降級層級與記憶摘要則綁入驗證過的 checkpoint,避免回滾順便清除安全狀態。

作者從 Agent-SafetyBench 建立成對的乾淨與受攻擊 episode,加入來源偽裝、記憶竄改、驗證器規避、冷卻等待及失控執行五類跨迭代攻擊。每類 200 個、合計 1,000 個攻擊 episode 中,完整配置的整體攻擊成功率為 0.1%,乾淨目標完成率為 96.9%;缺少主要模組的配置則有 88.4% 至 97.6% 攻擊成功率。單獨測試風險衰減時,風險值在兩次無證據迭代後跌破門檻,ASR 從 0% 跳至 97%,不衰減 latch 則維持 0%。

這些結果不能直接外推到生產環境。攻擊合約、權限代理規則與模型角色均由作者固定,完整系統也可能因永久 latch 過度阻擋後續合法工作;論文承認尚未提供經驗證的安全解除流程。下一步應測試跨 session 的授權清除、長期可用性,以及攻擊者能操控來源證明或安全狀態儲存層時的表現。

來源

  1. Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents
  2. Agent-SafetyBench repository