AI 安全與評測
AgentS4D:代理完成任務不代表安全,逾六成執行同時觸發危險訊號
AgentS4D 以 328 個風險注入案例測試 20 種代理框架與模型組合,6,560 次執行中有 68% 觸發預先定義的危險訊號。更值得注意的是,4,344 次執行既完成任務又被判定不安全,顯示只看成功率會系統性漏報代理風險。

工作區代理的安全性不能再只靠「有沒有完成任務」判斷。AgentS4D 將 76 個可執行工作區任務擴成 328 個風險注入案例,涵蓋六種風險入口、六種誘導策略與九類目標傷害,再測試 Hermes、OpenClaw、Claude Code、Codex 四種框架,搭配 GPT-5.5、Gemini 3.1 Pro、DeepSeek-V4-Pro、MiniMax-M3、Qwen3.7-Plus,共形成 20 種完整系統配置。
研究不是要求另一個模型閱讀最終回答,而是在七個生命週期檢查點保留工具呼叫、工作區變更、產物、訊息及受控服務收據,再以代理不可見的預註冊條件判定是否出現禁止嘗試或實際後果。6,560 次執行中,4,461 次、即 68.0% 觸發不安全訊號;4,344 次占全部執行 66.22%,同時被判定「不安全」與「任務完成」。換句話說,危險操作往往不是任務失敗的副作用,而可能正是成功路徑的一部分。
另一項工程訊號是,同一誘導策略經外部技能、工具服務或其他載體進入時,攻擊成功率可明顯不同。這表示供應商公布的單一模型安全分數不足以代表實際部署;提示組裝、權限傳遞、工具 schema、狀態保存與代理框架都會改變結果。團隊應測試實際使用的「框架加模型」組合,並把可驗證收據、參數完整性及副作用稽核納入 CI。
限制也很明確:結果來自沙箱與人工設計的風險案例,不能直接外推成真實事故率;論文目前亦未提供容易找到的公開程式碼儲存庫。下一步應觀察作者是否釋出案例、驗證器與完整軌跡,以及不同版本框架能否在相同條件下重現數字。