程式代理評測
AgentLens 把程式代理評測移到生產軌跡,支援夜間回歸與失敗診斷
AgentLens 不只檢查代理是否解出程式題,而是審查完整互動軌跡與實際產品結果。開源基準可用於比較模型版本、定位行為退化,並接入持續整合流程。

AgentLens 針對程式代理常見的評測盲點提出一套「生產評估軌跡審查」方法。傳統 SWE 類基準通常只看最終測試是否通過,但生產代理還可能重複搜尋、修改無關檔案、誤用工具、消耗過多 token,或在偶然通過測試時留下脆弱實作。AgentLens 因此把代理與環境互動的完整軌跡納入分析,讓團隊能同時觀察最終正確性、行動品質與失敗模式。
作者表示,他們已用這套方法比較自家代理的連續版本,並在夜間評測管線捕捉產品回歸;基準與工具已開源。這種定位很適合代理工程:模型、系統提示、工具 schema、沙箱與套件版本任何一項改變,都可能讓成功率不變但成本或風險上升。以軌跡為單位保存結果,也能把失敗分成規劃錯誤、資訊蒐集不足、執行錯誤、驗證不足或過早停止,進一步對應到可修改的系統元件。
但軌跡評分也會引入新的主觀性。若使用語言模型審查代理行為,評審模型可能偏好特定風格,且長軌跡的審查成本不低;生產題目若來自單一產品,也未必能代表其他程式庫或團隊流程。導入時應把可執行測試、靜態規則、人類抽查與軌跡評審分層使用,保存模型及環境版本,並報告成功率之外的 token、工具呼叫、時間和破壞性操作。