ホームへ戻る

AI 評測與代理系統

3つのエージェント・ベンチマークでモデルの主効果は3%未満、DDRがランキングをデプロイ信頼性の問題へと再定義

新たな研究が一般化可能性理論を用いて TheAgentCompany、τ²-bench、AppWorld を分解した結果、エージェントとタスクの交互作用が、エージェント自体の平均的な差を大きく上回ることが分かった。著者らは DDR レポーティング・フレームワークを提案し、選定時にタスク難易度、ホールドアウト検証、コスト、必要サンプル数を併せて報告するよう求めている。

Donald Trung Quoc Don (Chữ Hán: 徵國單) - Wikimedia Commons - © CC BY-SA 4.0 International.(Want to use this image?)Original publication 📤: --Donald Trung 『徵國單』 (No Fake News 💬) (WikiProject Numismatics 💴) (Articles 📚) 18:02, 8 June 2023 … · CC BY-SA 4.0 · Image source
zh-Hant

エージェントのランキングは複数のタスクを単一の成功率に集約するが、その順位を企業独自のワークロードで再現できるかについては、通常、答えが示されていない。Stanford AIMS のコースが公開した研究では、エージェント、タスク、トラジェクトリのステップ、エラー分類を4つの測定ファセットとして扱い、一般化可能性理論を用いて TheAgentCompany、τ²-bench、AppWorld の結果を分解した。データには、TheAgentCompany の7,783件のチェック、τ²-bench における3つのフロンティア・エージェントの3領域での複数回実行、AppWorld の79,650件のユニットテスト結果が含まれる。

REML 分析によると、すべてのデータセットとチェック種別で、エージェント自体の主効果は総分散の3%未満だった一方、エージェント×タスクの交互作用は約7~13%を占めた。ほかの分析も含めた論文要旨では、全体の範囲を7~23%としている。これはモデル間に差がないという意味ではなく、優位性が主として遭遇するタスクの種類に左右されるため、単一かつ移転可能な「エージェント能力」として解釈することが難しいということだ。Henderson Method-I、REML、ベイズ二項 GLMM という3つの推定手法でも、中核となる分散分解はおおむね一致した。

難しい問題だけを切り出すと、さらに大きなデプロイリスクが明らかになった。τ²-bench の `action_checks` における全体の一般化可能性係数 `Eρ²` は0.752だったが、最難関の四分位に限定すると0まで低下した。50回の70/30ホールドアウト実験では、訓練グリッドからの推定値とホールドアウト信頼性の間に `r=-0.90` という相関が見られ、平均で0.30過大評価されていた。そこで著者らは Deployment Decision Reliability(DDR)を提案した。DDR は分散表と D-study を用いて、必要なタスク数、サンプリングすべき難易度層、コスト制約下で順位が変わるか、ホールドアウトで実際に再現性を確認したか、といった問いに答える。

エンジニアリングチームは DDR を新たな万能スコアではなく、評価設計のチェックリストとして捉えられる。ただし、この研究で共有されているモデルファミリーは少数であり、データセット間の相関係数の一部は、わずか3つのファミリーから推定されている。また、データは既存の公開トラジェクトリに由来するため、同じ結論が特定企業の非公開ワークフローにも当てはまることを直接証明するものではない。次のステップでは、候補エージェント、実際のタスク分布、推論コストを固定したうえで、D-study が推奨するサンプル数を前向きに検証すべきである。

出典

  1. Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations
  2. CS321M: AI Measurement Science — Deployment Decision Reliability
  3. Agent Reliability Engineering Lab