AI 評測與代理系統
3つのエージェント・ベンチマークでモデルの主効果は3%未満、DDRがランキングをデプロイ信頼性の問題へと再定義
新たな研究が一般化可能性理論を用いて TheAgentCompany、τ²-bench、AppWorld を分解した結果、エージェントとタスクの交互作用が、エージェント自体の平均的な差を大きく上回ることが分かった。著者らは DDR レポーティング・フレームワークを提案し、選定時にタスク難易度、ホールドアウト検証、コスト、必要サンプル数を併せて報告するよう求めている。