返回首頁

代理評測與可觀測性

A²E 統一 23 項基準與 9 種代理外殼,單格評測仍只有 5 題

上海人工智慧實驗室公開 A²E,以 Agent Task Protocol 解耦基準、代理外殼與軌跡評分。1,035 次配對實驗顯示外殼會改變工具使用與 token 成本,但樣本量不足以支撐框架排行榜。

Transferred from en.wikipedia to Commons. This media comes from the Centers for Disease Control and Prevention's Public Health Image Library (PHIL), with identification number #5605. Note: Not all PHIL images are public domain; be sure to … · Public domain · Image source
zh-Hant

上海人工智慧實驗室團隊公開 A²E(Agent Auditing Engine),試圖把代理評測從「每套框架各寫一個基準轉接器」改成可組合的協定。其 Agent Task Protocol 將任務輸入、工具、沙箱狀態與輸出軌跡標準化;Task、Monitor、Evaluation 三層則分別負責執行、以 OpenTelemetry/OpenInference span 擷取模型與工具呼叫,以及評估規劃、工具使用、答案、成本和安全性。專案目前列出 LangGraph、CrewAI、Google ADK、AutoGen、Smolagents、Agno、LlamaIndex、Claude Agent SDK 與 OpenAI Agents SDK,並涵蓋 SWE-bench、Terminal-Bench、τ-bench 等 23 項基準。

論文以相同模型、解碼參數、工具及逾時設定完成 23×9、共 1,035 次執行。19 項非沙箱基準另產生 855 條完整軌跡;八個具 token 記錄的外殼,平均消耗由 2,063 至 7,319 token,相差 3.5 倍。部分多輪任務的成功率也明顯分岔,例如 Traject-Bench 橫跨 0.20 至 1.00,說明外殼的控制迴圈、工具轉換與上下文管理不是無關緊要的包裝層。

但每個「框架×基準」單格只抽五題,分數最小跳幅達 0.20,作者也明確表示結果不適合拿來排名。註冊支援亦不代表所有組合都通過端到端驗證;CrewAI 的 span 缺少 token 數,部分工具調用與幻覺欄位更由儀器設定,不能解讀成框架行為。工程團隊可先把 A²E 視為本機、資料庫化的評測骨架;下一步應觀察其協定能否維持版本相容、擴大重複樣本,以及儲存庫是否補上明確軟體授權。

來源

  1. An End-to-End Agent Auditing Engine
  2. datamllab/A2E