返回首頁

代理安全

PolicyGuide 以持久化流程圖約束客服代理,四次全過率由 0.42 升至 0.62

PolicyGuide 不只在工具呼叫前阻擋違規動作,而是在每個使用者回合追蹤尚未完成的政策步驟。它在三個 τ²-bench 領域提高可靠成功率,但每回合增加一次 LLM 驗證,且程序合規指標部分由作者自行設計。

Presidential Press and Information Office · CC BY 4.0 · Image source
zh-Hant

一項新研究提出 PolicyGuide,把客服代理的政策從自然語言文件編譯成可遍歷的工作流程圖,再由獨立驗證器持續追蹤執行位置。與只在退款、改票或帳戶修改等寫入工具即將呼叫時檢查參數的 guard 不同,PolicyGuide 能在代理漏掉身分確認、資格查詢、使用者同意或操作後驗證時,提早指出第一個尚未滿足的節點。

離線階段會把政策與工具清單編譯、修補及驗證成固定流程包。線上階段則在每個使用者回合前呼叫一次驗證 LLM,輸入對話、工具結果、流程圖及由程式碼持有的請求狀態;驗證器可同時整理多個未結請求,輸出目前節點、證據、允許的變更工具與修正指示。若代理過早發出未獲授權的寫入呼叫,系統會攔截一次並再次產生修正,但隨後解除一次性閘門,避免流程死鎖。

以 GPT 5.4 同時擔任代理及驗證器,在 τ²-bench 的航空、零售及電信共 278 項任務上,跨領域 `Pass^4` 平均由無引導 ReAct 的 0.42 升至 0.62;電信領域由 0.193 升至 0.614。`Pass^4` 要求同一任務四次試跑全部成功,因此比單次成功率更重視可靠性。相同航空流程圖毋須重寫便可套用 Claude Sonnet 4.6 與 Gemini 2.5 Pro;Gemini 的整體 `Pass^4` 由 0.48 升至 0.68。

技術價值在於把政策狀態留在可檢查的外部控制層,而非依靠代理記憶。不過零售相對 ReAct 的改善未達顯著,評測僅涵蓋英文模擬客服;作者自製的時序稽核也沒有第二位標註者一致性資料。部署前仍須量測每回合驗證造成的延遲、費用,以及流程圖過時或編譯錯誤時的失效模式。

來源

  1. PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents
  2. τ-Bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains