ホームへ戻る

代理安全

PolicyGuide、永続的なフロー図でカスタマーサポートエージェントを制約し、4回連続合格率を0.42から0.62に向上

PolicyGuideは、ツール呼び出しの直前にポリシー違反のアクションを阻止するだけでなく、各ユーザーターンで未完了のポリシーステップを追跡する。3つのτ²-benchドメインで信頼性の高い成功率を向上させた一方、ターンごとに1回のLLM検証が追加され、手続き遵守の指標の一部は著者らが独自に設計している。

Presidential Press and Information Office · CC BY 4.0 · Image source
zh-Hant

新たな研究で提案されたPolicyGuideは、カスタマーサポートエージェント向けのポリシーを自然言語文書から走査可能なワークフロー図へコンパイルし、独立した検証器によって実行位置を継続的に追跡する。返金、予約変更、アカウント変更などの書き込みツールが呼び出される直前にパラメータだけを検査するguardとは異なり、PolicyGuideは、エージェントが本人確認、適格性の照会、ユーザーの同意、操作後の検証を省略した場合、最初に未充足となっているノードを早期に特定できる。

オフライン段階では、ポリシーとツール一覧をコンパイル、修復、検証し、固定されたワークフローパッケージを生成する。オンライン段階では、各ユーザーターンの前に検証用LLMを1回呼び出し、会話、ツールの結果、フロー図、およびコード側で保持されるリクエスト状態を入力する。検証器は複数の未完了リクエストを同時に整理し、現在のノード、根拠、許可された変更ツール、修正指示を出力できる。エージェントが承認されていない書き込み呼び出しを早まって発行した場合、システムはその呼び出しを一度遮断して修正案を再生成するが、その後は一回限りのゲートを解除し、ワークフローのデッドロックを回避する。

GPT 5.4をエージェントと検証器の両方に使用し、τ²-benchの航空、リテール、通信という3ドメイン、計278タスクで評価したところ、ドメイン横断の平均`Pass^4`は、ガイダンスなしのReActにおける0.42から0.62へ上昇した。通信ドメインでは0.193から0.614へ向上した。`Pass^4`では同一タスクの4回の試行すべてに成功する必要があるため、単発の成功率よりも信頼性を重視する。同じ航空ドメインのフロー図は、書き直すことなくClaude Sonnet 4.6とGemini 2.5 Proにも適用できた。Geminiの全体的な`Pass^4`は0.48から0.68へ上昇した。

技術的な価値は、ポリシーの状態をエージェントの記憶に依存させず、検査可能な外部制御レイヤーに保持する点にある。ただし、リテールドメインにおけるReAct比の改善は統計的有意性に達しておらず、評価対象も英語による模擬カスタマーサポートに限られている。著者らが独自に作成した時系列監査についても、2人目のアノテーターとの一致度データは示されていない。導入前には、ターンごとの検証によって生じるレイテンシーとコストに加え、フロー図が古くなった場合やコンパイルエラーが発生した場合の障害モードを測定する必要がある。

出典

  1. PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents
  2. τ-Bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains