ホームへ戻る

AI 安全

MostarGate、3層の権限の共通部分でエージェント認証情報を縮小——600問のデータセットがまず企業ポリシーの不備を浮き彫りに

新たな研究では、エージェントが利用できる権限を、ロール上限、タスク分類、禁止される組み合わせという3要素の共通部分に限定し、各タスクで完全なロール認証情報を保持することを防ぐ。公開データセットは600件の企業タスクを15種類の最小権限に対応付けているが、93%の改善が示すのはポリシー改訂の効果であり、導入済みシステムにおける攻撃阻止率ではない。

Aradic-es · Public domain · Image source
zh-Hant

MostarGateの研究は、企業向けエージェントで一般的な「静的フルプロビジョニング」の問題を対象としている。エージェントは起動時に、特定のロールで使用する可能性があるすべてのツールと認証情報を取得するため、現在のタスクが文書の要約にすぎない場合でも、データベース、外部メール、HTTPへのアクセス権限を保持している可能性がある。著者らは3つの情報源からなるアーキテクチャを提案し、最終的な権限をその共通部分に限定する。まず、ロールまたはサービスアイデンティティーによって越えられない上限を設定する。次に、独立したタスクコンテキスト分類器が、そのタスクに必要なツールを予測する。最後に、決定論的ポリシーによって危険な権限の組み合わせを除外する。

第3層は特に、間接プロンプトインジェクションにおける「致命的な三角形」を扱う。これは、非公開データ、信頼できないコンテンツ、外部通信の3つに同時にアクセスできる状態を指す。ポリシーの例では、`database_read`と`http_request`、または`email_send_external`が同時に付与されることを禁止している。分類器はエージェントによる権限の自己申告を受け付けず、オーケストレーターは3層すべての判定を通過した認証情報だけをデプロイする。また、システムは最初にobserve-onlyモードで動作させることもできる。このモードでは完全なロール権限を維持しつつ、本来なら拒否されるツール呼び出しを記録する。これはSELinuxのpermissiveモードによる導入に似ている。

GPL-3.0で公開されたデータセットには、6つの架空部門、600件のタスクプロンプト、GitHub、Jira、Slack、データベース、外部メールなどに対応する15種類の最小権限ラベルが含まれる。プロンプト生成と権限ラベル付けは2回のモデル呼び出しに分けられており、生成されたテキストがラベル付けのロジックを直接漏らすという循環性を抑えている。60件を対象とした688個の人手によるレビュー判定では、意見の相違を解消した後のCohen's kappaは0.967だった。また、データ生成の過程で元のポリシーにおける46件のロール上限の競合が見つかり、改訂後には3件まで減少した。

この93%の減少を、攻撃の93%を阻止できるという意味に解釈してはならない。測定しているのは、合成タスクと改訂されたポリシーとの間にある上限の競合だけである。完全な分類器については、敵対的プロンプト、実際の企業ワークフロー、効用損失に関する評価がまだ行われていない。また論文では、分類器、認証情報サービス、オーケストレーターが信頼できることを明示的に前提としている。今後の重要課題は、権限の過剰付与と過少付与、分類レイテンシー、さらにタスク実行中に要件が変化した場合の安全な権限昇格プロセスを測定することだ。

出典

  1. Dynamic Capability Scoping for Enterprise AI Agents
  2. MostarGate dataset and generation pipeline