代理評測與安全
AgentAudit 把代理評測拆成十個生命週期環節,但模型裁判仍是最大變因
AgentAudit 不只計算任務是否完成,而是從執行軌跡分別檢查規劃、記憶、工具選擇、安全與執行完整性。五款模型的綜合信任分數差距很大,但九項任務與單一模型裁判不足以支持通用排名。

多數代理基準只回答「任務有沒有完成」,難以判斷錯誤究竟源自規劃、記憶、工具參數,還是模型服從了惡意指令。9 月 9 日公開的 AgentAudit 改從完整 execution trace 著手,把一次代理執行分成 instruction integrity、planner、memory、tool selection、tool invocation、tool correctness、alignment、tool faithfulness、security 與 execution integrity 十個面向,再附加行為分類及失敗歸因。
這種設計的技術價值在於,評測器附著於既有代理、只讀取軌跡,不必取代代理框架。團隊因此可以在相同觀測格式下比較不同模型與 harness,也能區分「能力不足而失敗」和「具備能力、卻遵從攻擊要求」:後者被標記為 `Unsafe_Compliance`,對具有檔案、資料庫或網路權限的代理尤其重要。
作者以九項能力與對抗任務測試五款模型。論文報告 Claude Sonnet 5、GPT-5 的平均 Composite Trust Score 分別為 95.1、80.6;Sarvam 105B、Llama 3.3 70B、Gemini 2.5 Flash 則為 57.6、45.7、22.6。這些數字不應視為一般能力排行榜:樣本很小,任務與代理配置可能偏向特定模型,而且所有軌跡都由同一固定模型裁判評分;該裁判本身還是受測模型之一,會引入自我偏好與尺度校準問題。
工程團隊可借用其分層歸因方式建立回歸測試,但下一步應觀察作者是否公開完整任務、軌跡、評分提示及人工一致性研究。只看日誌也有固有限制:未被 instrumentation 記錄的環境狀態、隱藏工具副作用或遭刪改的記憶,仍可能逃過稽核。