返回首頁

AI 評測與代理系統

三套代理基準的模型主效應低於 3%,DDR 將排行榜改寫成部署可靠度問題

一項新研究以廣義性理論拆解 TheAgentCompany、τ²-bench 與 AppWorld,發現代理與任務的交互作用遠大於代理本身的平均差異。作者提出 DDR 報告框架,要求選型時同時交代任務難度、留出驗證、成本與所需樣本量。

Donald Trung Quoc Don (Chữ Hán: 徵國單) - Wikimedia Commons - © CC BY-SA 4.0 International.(Want to use this image?)Original publication 📤: --Donald Trung 『徵國單』 (No Fake News 💬) (WikiProject Numismatics 💴) (Articles 📚) 18:02, 8 June 2023 … · CC BY-SA 4.0 · Image source
zh-Hant

代理排行榜把多項任務壓成一個成功率,但這個名次能否在企業自己的工作負載重現,通常沒有答案。史丹福 AIMS 課程釋出的研究把代理、任務、軌跡步驟及錯誤類別視為四個測量面向,使用廣義性理論分解 TheAgentCompany、τ²-bench、AppWorld 的結果;資料合計包括 TheAgentCompany 的 7,783 筆檢查、τ²-bench 三款前沿代理在三個領域的多次執行,以及 AppWorld 的 79,650 筆單元測試結果。

REML 分析顯示,各資料集與檢查類型中,代理本身的主效應都不到總變異的 3%,代理×任務交互作用則占約 7% 至 13%;論文摘要納入其他分析後給出的整體範圍為 7% 至 23%。這不表示模型沒有差異,而是優勢主要取決於碰到哪類任務,難以解讀成單一、可轉移的「代理能力」。三種估計器——Henderson Method-I、REML 與貝葉斯二項 GLMM——所得核心分解大致一致。

難題切片暴露更大的部署風險:τ²-bench `action_checks` 的整體廣義係數 `Eρ²` 為 0.752,限制到最難四分位後降至 0。50 次 70/30 留出實驗中,訓練格推算值與留出可靠度更出現 `r=-0.90`,平均高估 0.30。作者因此提出 Deployment Decision Reliability(DDR),用變異表與 D-study 回答需要多少任務、應抽哪個難度層、成本限制下排名是否改變,以及是否真的做過留出重現。

工程團隊可把 DDR 視為評測設計清單,而非新的萬用分數。不過研究只有少量共享模型家族,部分跨資料集相關係數僅由三個家族估算;資料亦來自既有公開軌跡,不能直接證明相同結論適用於特定公司的私有流程。下一步應在候選代理、真實任務分布與推論成本都固定後,前瞻驗證 D-study 建議的樣本量。

來源

  1. Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations
  2. CS321M: AI Measurement Science — Deployment Decision Reliability
  3. Agent Reliability Engineering Lab