代理評測與可觀測性
A²E 統一 23 項基準與 9 種代理外殼,單格評測仍只有 5 題
上海人工智慧實驗室公開 A²E,以 Agent Task Protocol 解耦基準、代理外殼與軌跡評分。1,035 次配對實驗顯示外殼會改變工具使用與 token 成本,但樣本量不足以支撐框架排行榜。

上海人工智慧實驗室團隊公開 A²E(Agent Auditing Engine),試圖把代理評測從「每套框架各寫一個基準轉接器」改成可組合的協定。其 Agent Task Protocol 將任務輸入、工具、沙箱狀態與輸出軌跡標準化;Task、Monitor、Evaluation 三層則分別負責執行、以 OpenTelemetry/OpenInference span 擷取模型與工具呼叫,以及評估規劃、工具使用、答案、成本和安全性。專案目前列出 LangGraph、CrewAI、Google ADK、AutoGen、Smolagents、Agno、LlamaIndex、Claude Agent SDK 與 OpenAI Agents SDK,並涵蓋 SWE-bench、Terminal-Bench、τ-bench 等 23 項基準。
論文以相同模型、解碼參數、工具及逾時設定完成 23×9、共 1,035 次執行。19 項非沙箱基準另產生 855 條完整軌跡;八個具 token 記錄的外殼,平均消耗由 2,063 至 7,319 token,相差 3.5 倍。部分多輪任務的成功率也明顯分岔,例如 Traject-Bench 橫跨 0.20 至 1.00,說明外殼的控制迴圈、工具轉換與上下文管理不是無關緊要的包裝層。
但每個「框架×基準」單格只抽五題,分數最小跳幅達 0.20,作者也明確表示結果不適合拿來排名。註冊支援亦不代表所有組合都通過端到端驗證;CrewAI 的 span 缺少 token 數,部分工具調用與幻覺欄位更由儀器設定,不能解讀成框架行為。工程團隊可先把 A²E 視為本機、資料庫化的評測骨架;下一步應觀察其協定能否維持版本相容、擴大重複樣本,以及儲存庫是否補上明確軟體授權。