ホームへ戻る

代理評測與安全

AgentAuditはエージェント評価を10のライフサイクル段階に分解するが、モデル審査員が依然として最大の変動要因

AgentAuditはタスクが完了したかどうかを計算するだけでなく、実行軌跡から計画、メモリ、ツール選択、安全性、実行の完全性を個別に検査する。5モデルの総合信頼スコアには大きな差があるものの、9つのタスクと単一のモデル審査員だけでは汎用的なランキングを裏付けるには不十分だ。

Ministry of External Affairs · GODL-India · Image source
zh-Hant

多くのエージェントベンチマークは「タスクを完了できたか」しか評価せず、エラーの原因が計画、メモリ、ツールのパラメータのどれにあるのか、あるいはモデルが悪意ある指示に従ったことにあるのかを判別しにくい。9月9日に公開されたAgentAuditは、完全なexecution traceを起点とするアプローチを採用し、1回のエージェント実行をinstruction integrity、planner、memory、tool selection、tool invocation、tool correctness、alignment、tool faithfulness、security、execution integrityという10の観点に分解したうえで、行動分類と失敗原因の帰属も付加する。

この設計の技術的価値は、評価器を既存のエージェントに接続し、軌跡を読み取るだけで済むため、エージェントフレームワークを置き換える必要がない点にある。これによりチームは、同一の観測フォーマットで異なるモデルやharnessを比較できるほか、「能力不足による失敗」と「能力はあるが攻撃者の要求に従ったケース」を区別できる。後者は`Unsafe_Compliance`と分類され、ファイル、データベース、ネットワークへのアクセス権限を持つエージェントにとって特に重要である。

著者らは、能力評価および敵対的評価からなる9つのタスクで5モデルをテストした。論文によれば、Claude Sonnet 5とGPT-5の平均Composite Trust Scoreはそれぞれ95.1と80.6だった。一方、Sarvam 105B、Llama 3.3 70B、Gemini 2.5 Flashは、それぞれ57.6、45.7、22.6だった。これらの数値を一般的な能力ランキングと見なすべきではない。サンプル数が少なく、タスクやエージェント構成が特定のモデルに有利である可能性があるうえ、すべての軌跡が単一の固定されたモデル審査員によって採点されているためだ。さらに、その審査員自体も評価対象モデルの一つであり、自己選好や評価尺度のキャリブレーションに関する問題が生じる。

エンジニアリングチームは、この階層的な原因帰属手法を取り入れて回帰テストを構築できる。ただし次に注目すべきは、著者らが完全なタスク、軌跡、評価プロンプト、人間の評価者との一致度に関する研究を公開するかどうかだ。ログだけを調べる手法にも本質的な限界がある。instrumentationに記録されなかった環境状態、ツールの隠れた副作用、削除または改変されたメモリは、依然として監査をすり抜ける可能性がある。

出典

  1. AgentAudit: An Open, Extensible Framework for Full-Lifecycle Trust Evaluation of AI Agents
  2. AgentAudit paper record and research-signal summary