ホームへ戻る

AI 代理與可靠度

同一モデルの2エージェント、失敗タスクの90%で共倒れ——独立性の仮定が冗長化の信頼性を過大評価

Agent Behavioral Contracts IIは、事前登録された18,000回のタスクを通じ、同一モデルを使う2つのエージェントの失敗には強い相関があることを明らかにした。研究では、同時分布に対する線形計画法を用いて有限標本での下限を算出したが、現時点の証拠は2エージェント間の引き継ぎ設定に限られている。

Albert Demuyser · CC BY-SA 3.0 · Image source
zh-Hant

マルチエージェントシステムでは、各コンポーネントの成功率を掛け合わせ、ワークフロー全体の信頼性を見積もることが多い。しかし、この計算法は実際には、所与のタスク条件の下で各エージェントが互いに独立していると仮定している。新たな研究「Agent Behavioral Contracts II」は、この仮定を直接検証した。LLMジャッジを使わず、決定論的プログラムで評価した事前登録済みの18,000回のタスクでは、同一モデルを使う2つのエージェントが、「少なくとも一方が失敗した」タスクの90.0%で共に失敗し、ファイ係数は0.916に達した。つまり、同じモデルを複製しても、独立したバックアップを2系統確保したことにはならない。

著者らがモデルを1つずつ別のものに置き換えたところ、6組すべての比較で失敗の相関が低下した。一方、すでに異なるモデルを使用している条件では、さらにプロバイダーを分けても有意な改善は見られなかった。これは、エンジニアリング上追跡すべきなのはエラーのメカニズムとモデルの多様性であり、APIの提供元が別会社かどうかだけでは不十分であることを示している。正の依存関係があると、実際の同時失敗率は独立性を仮定した積より高くなるため、「2つのエージェントによる相互検証」がもたらす安全性向上は、体系的に過大評価されている可能性がある。

研究では、依存構造を特定せずに利用できる有限標本保証も提案している。まず、同時実行で測定したモーメントをBonferroni–Clopper–Pearson区間で包含し、次に線形計画法を用いて、それらと整合するすべての同時分布の中から最悪ケースの信頼性を求める。モーメント条件を10個から14個に増やすと識別区間は85.7%縮小し、認証可能な下限は0.2455から0.4116へ上昇した。オプショナルストッピングを可能にしたバージョンの第I種過誤率は0.0471だった。コード、分析スクリプト、事前登録文書は公開されているものの、現時点では単一のプレプリントにすぎず、2エージェント間の引き継ぎ設定が大規模で異種混成のエージェントグラフを代表するとは限らない。デプロイ担当チームは今後、各エージェントの周辺成功率だけを報告するのではなく、タスク単位の同時失敗データを保存すべきである。

出典

  1. Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence
  2. AgentAssert ABC repository