AI 評測與代理系統
三套代理基準的模型主效應低於 3%,DDR 將排行榜改寫成部署可靠度問題
一項新研究以廣義性理論拆解 TheAgentCompany、τ²-bench 與 AppWorld,發現代理與任務的交互作用遠大於代理本身的平均差異。作者提出 DDR 報告框架,要求選型時同時交代任務難度、留出驗證、成本與所需樣本量。

代理排行榜把多項任務壓成一個成功率,但這個名次能否在企業自己的工作負載重現,通常沒有答案。史丹福 AIMS 課程釋出的研究把代理、任務、軌跡步驟及錯誤類別視為四個測量面向,使用廣義性理論分解 TheAgentCompany、τ²-bench、AppWorld 的結果;資料合計包括 TheAgentCompany 的 7,783 筆檢查、τ²-bench 三款前沿代理在三個領域的多次執行,以及 AppWorld 的 79,650 筆單元測試結果。
REML 分析顯示,各資料集與檢查類型中,代理本身的主效應都不到總變異的 3%,代理×任務交互作用則占約 7% 至 13%;論文摘要納入其他分析後給出的整體範圍為 7% 至 23%。這不表示模型沒有差異,而是優勢主要取決於碰到哪類任務,難以解讀成單一、可轉移的「代理能力」。三種估計器——Henderson Method-I、REML 與貝葉斯二項 GLMM——所得核心分解大致一致。
難題切片暴露更大的部署風險:τ²-bench `action_checks` 的整體廣義係數 `Eρ²` 為 0.752,限制到最難四分位後降至 0。50 次 70/30 留出實驗中,訓練格推算值與留出可靠度更出現 `r=-0.90`,平均高估 0.30。作者因此提出 Deployment Decision Reliability(DDR),用變異表與 D-study 回答需要多少任務、應抽哪個難度層、成本限制下排名是否改變,以及是否真的做過留出重現。
工程團隊可把 DDR 視為評測設計清單,而非新的萬用分數。不過研究只有少量共享模型家族,部分跨資料集相關係數僅由三個家族估算;資料亦來自既有公開軌跡,不能直接證明相同結論適用於特定公司的私有流程。下一步應在候選代理、真實任務分布與推論成本都固定後,前瞻驗證 D-study 建議的樣本量。