返回首頁

代理與程式設計評測

τ^τ-Bench 把「建造代理」本身納入評測,最佳程式代理僅達專家參考的三成

Sierra 的新基準不再只測試成品代理,而是要求程式代理從零散業務資料、客戶訪談與既有程式碼建成可部署的客服系統。最佳組合在隱藏模擬流量只通過 23.9%,暴露需求發掘、架構探索與驗證不足。

DanDawson · CC0 · Image source
zh-Hant

Sierra Research 公開 τ^τ-Bench(Hyper-τ),把評測外層從「代理能否服務使用者」擴大為「程式代理能否建造另一個代理」。每項任務提供企業實際可能留下的操作手冊、客服紀錄、試算表、截圖、音訊與流程圖,另有一名掌握未記錄需求的模擬客戶。開發代理必須在隔離環境讀懂材料、訪談客戶、接手空白或既有程式庫,並整合可能暗藏缺陷的 REST API。

提交物不是文字答案,而是完整可執行的客服代理。評測器把它部署到未公開的模擬使用者流量,依最後資料庫狀態、傳達給客戶的資訊,以及平均每段對話的模型額度計分。53 項發布任務橫跨航空、零售、電信與銀行;航空及零售資料另行改寫品牌、數值與政策,以降低模型背誦既有 τ-bench 題目的可能。程式庫支援 Codex、Claude Code、OpenCode 與 Prime Agent,並把模型路由、容器映像及任務合約固定下來,讓「模型」與「代理執行框架」可以分開比較。

首批結果中,Claude Opus 5 搭配 Claude Code 得分 23.9%,GPT-5.6-sol 搭配 Codex 為 22.0%;專家撰寫的參考代理則為 82.2%。論文分析指出,程式代理常以關鍵字搜尋取代完整閱讀、很少向客戶追問,且傾向修補第一個能執行的架構,再用自己撰寫、帶有相同盲點的測試驗證。這比單純的程式修補基準更接近代理專案交付,但 82.2%是專家參考實作而非普遍人類能力,模擬客戶與模型裁判也可能引入偏差。後續關鍵是不同團隊能否在相同路由、成本與密封測試條件下重現排名。

來源

  1. τ^τ-Bench paper
  2. τ^τ-Bench public leaderboard
  3. sierra-research/hyper-tau-bench repository