返回首頁

AI 安全

HazardAuditor 統一四種電腦代理軌跡,以序列級獎勵訓練安全守門模型

HazardAuditor 將 Claude Code、Codex、Hermes 與 OpenClaw 的工具執行轉成共同事件格式,再判斷整段行為是否安全。新的 GuardPO 讓最終安全判定主導更新,但研究資料未公開,最高 16.5 個百分點增益仍待獨立重現。

Kotivalo · CC BY-SA 3.0 · Image source
zh-Hant

電腦操作代理的風險通常不在單一句文字,而在「讀取檔案、執行命令、呼叫外部服務」串成的完整行為。Ant Group 等研究者提出 HazardAuditor,在受控環境中實際執行 Claude Code、Codex、Hermes 與 OpenClaw,再把各框架不同的提示、推理、工具參數及環境回傳,正規化成共同的軌跡事件。守門模型讀取整段紀錄後,先生成可稽核理由,再輸出確定的 `safe` 或 `unsafe` 標籤;僅出現惡意文字、但代理已拒絕執行的案例,不會自動算作危險。

訓練上的關鍵改動是 Guard Policy Optimization。一般 token 級 SFT 或策略更新會讓較長的分析文字累積更多梯度,使模型學會「寫很長的理由」,卻不一定改善最後的安全判斷。GuardPO 把可執行環境產生的確定結果轉為序列級 advantage,並分別正規化理由區與 verdict 區,使一整次安全決策成為實際最佳化單位。

專案報告在平衡安全與危險軌跡的 CUA-Exec 上,SFT 版本準確率為 80.50%,加入 GuardPO 後升至 90.88%。相較研究列出的最強既有 guard,Claude Code、Codex、Hermes 與 OpenClaw 子集分別改善 12.5、4.0、9.5 與 16.5 個百分點;在 AgentHazard、R-Judge、ASSE-Safety、ATBench 等外部評測也報告約 87.6% 至 91.5% 準確率。

程式、8B checkpoint、SFT 與 GuardPO 配方已公開,推論器也會把軌跡標為不可信資料;無法解析的輸出回傳空標籤,而非默認安全。不過倉庫未包含研究用軌跡、逐筆預測或訓練輸出,外界暫時無法完整重算結果。更重要的是,這是事後軌跡分類器,不能撤銷已完成的副作用;實際系統仍需最小權限、執行前政策、隔離環境與人工確認。

來源

  1. HazardAuditor: From Executable Threats to Safer Computer-Use Agents
  2. HazardAuditor official code repository
  3. HazardAuditor paper and model discussion