ホームへ戻る

代理安全與執行期授權

CAGE、エージェントのツール応答に結合認可証明を導入し、フィールドの誤バインディングと数値ドリフトによるゲート回避を防止

CAGEは、エージェントがその時点で参照しているツール応答だけでなく、正しくバインドされた可能性のある結果の集合すべてが同じアクションを許可するかを検証する。研究では、カテゴリフィールドと数値誤差を個別に検査しても、両者が同時に変化した際の安全性は保証できないことが示された。

Internet Archive Book Images · No restrictions · Image source
zh-Hant

ツール利用型エージェントは通常、MCPまたはAPIの応答を型付きレコードとして解析し、その後のアクションを実行できるかどうかを認可ゲートで判断する。CAGEによると、現在の手法の多くは、目の前にある「応答—アクション」の組み合わせしか検証していない。情報源ラベルの誤バインディング、データの陳腐化、または許容誤差内での数値ドリフトが生じると、実際にはポリシーに適合しない取引でもゲートが許可してしまう可能性がある。

研究では、ツール応答を情報源・カテゴリフィールドと連続値フィールドに分解した。脅威モデルでは、許容範囲内の離散的なバインディングエラー1件に、有界な数値オフセットが加わることを想定する。重要な結果は、2種類の周辺的な証明をそのまま組み合わせることはできないという点だ。あるアクションが、「情報源だけを入れ替える」検査と「数値だけを変更する」検査にはそれぞれ合格しても、情報源と数値を同時に変更すると別のポリシー閾値を越える可能性がある。例えば、同じリスクスコアであっても、信用調査と制裁スクリーニングでは承認基準が異なり得る。

そこでCAGEは、まず離散近傍を網羅的に列挙し、各分岐について連続的な摂動を検証する。認可ポリシー自体が実行可能な場合、CAGE-Exactはポリシーを直接証明する。それ以外の場合、CAGE-Lipは1-Lipschitzゲートを使用し、CAGE-RSはrandomized smoothingによって証明を構築する。ただし、後者2つが証明できるのは学習済み分類器のみであり、実際のポリシーとの整合性を別途測定する必要がある。証明範囲を超えるケースでは自動実行を拒否し、人間による処理へ引き継ぐ。

著者らは、合成データ、OPA/Rego policy-as-code、規制ルール、実取引データ用アダプターで評価を行い、摂動予算内のfalse allowを排除しながら、一定の自律的な意思決定を維持できたとしている。ライブラリには、表形式マッピング用コマンド、CPU向けスモークテスト、Kubernetes、Kyverno、MCPのテストフレームワークが用意され、結果を照合しやすくなっている。ただし、その保証は、エラー近傍が実際のデプロイ環境をどの程度カバーしているかに依存する。また、プロンプトインジェクションや悪意のあるテキストは対象外であり、検証済みの型付き応答だけを保護する。今後は、実システムにおけるバインディングエラー率、人間への引き継ぎ率、大規模schemaの列挙コストを観察する必要がある。

出典

  1. CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents
  2. CAGE agent authorization reference implementation