返回首頁

AI safety evaluation

REDAgentBench 以服務最終狀態重算代理攻擊率,文字軌跡漏判最高 11.72 個百分點

REDAgentBench 在工作區、郵件、瀏覽器、銀行與外部檔案沙箱執行 1,661 個攻擊案例,不再只憑代理回答判斷是否造成傷害。同一批執行改用服務收據與最終狀態評分後,六款模型的攻擊成功率均較純軌跡評分高 7.73 至 11.72 個百分點。

GParted developers · GPL · Image source
zh-Hant

代理安全測試常把回答、工具呼叫及思考軌跡交給評審模型,再輸出單一攻擊成功率;REDAgentBench 認為,這會混合「攻擊是否抵達代理、代理是否執行、評審看見哪些證據、證據如何判定」四個不同階段。它建立 1,661 個可執行案例,涵蓋 15 種介入方式、11 類系統弱點與 28 項安全限制,並在隔離的工作區、郵件、瀏覽器、銀行及外部檔案服務中記錄檔案修改、寄件與轉帳等持久效果。

每次測試開始前先保存服務基準狀態,結束後再取得結構化收據與狀態差異。確定性驗證器優先處理可直接判定的欄位,只有語意型限制才交給要求引用證據的模型評審。這讓系統可分別比較軌跡、狀態及混合視角,而不必相信代理宣稱「已拒絕」或「未完成」。

研究以 GPT-5.2、三款 Qwen、Kimi K2.6 與 GLM-5.2,搭配 Codex、Hermes及 OpenClaw 三種代理外殼執行矩陣測試。混合評審下的宏平均攻擊成功率為 65.69%,但模型排名及絕對數字會隨外殼改變;固定同一批 rollout 與評審骨幹後,狀態視角仍比軌跡視角多判出 7.73 至 11.72 個百分點的成功攻擊,12.97% 至 21.20% 的配對標籤發生改變。

另一項診斷顯示,在具有明確動作定位的已確認違規中,接近五分之一發生於代理已先說出相關限制之後。於動作邊界再次注入個案政策提醒,在配對重播中令確認違規下降逾 70 個百分點;這說明安全規則「被模型說出來」不等於真正控制工具執行。

不過,作者尚未提供可下載的基準儲存庫,外界目前不能完整稽核案例生成器、服務沙箱或重跑結果。大幅下降也來自歷史有害案例的選擇性重播,不能解讀為所有代理流量都會獲得相同改善。工程團隊下一步應要求安全排行榜同時披露外殼、工具中介層、證據視角、有效 rollout 分母與最終狀態驗證方式。

來源

  1. REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems
  2. NousResearch/hermes-agent
  3. openai/codex