代理評測
OmniaBench 以 1,431 項跨場景任務檢驗通用代理,前沿模型 Pass@1 仍低於六成
OmniaBench 建立具明確狀態空間的跨工具、跨互動形式代理測試,並提供 644 題精簡困難集。結果顯示,規劃、約束維持與錯誤後調整仍是前沿代理的共同弱點。

OmniaBench 將通用代理評測從單一網站、工具集或對話形式擴展到異質場景。完整資料集包含 1,431 項任務,另提供 644 項的困難子集,以降低重複評測成本,並減少完整題庫公開後遭訓練資料污染的風險。每個環境具有明確狀態空間,讓評分不只依賴另一個語言模型的主觀判斷,而能檢查代理採取的動作是否真的把系統推進至目標狀態。
論文報告 Claude Sonnet 5 與 GPT-5.6 Sol 的整體 Pass@1 分別只有 58.54% 與 57.14%。作者進一步把失敗拆成領域與能力維度,指出目前模型即使能正確呼叫工具,仍常在多步規劃、長時間維持限制條件,以及觀察到失敗後調整策略方面出錯。對生產團隊而言,這種診斷比單一總分更有用:它能協助判斷應改善提示、狀態表示、驗證器、回退策略,還是更換基礎模型。
不過,Pass@1 仍會受到代理框架、工具描述、推理預算、取樣設定與失敗重試政策影響;不同供應商的原生工具介面也可能讓比較失真。困難子集只能延緩污染,不能消除模型在未來版本記住題目的可能。採用者應固定模型版本與執行環境、保存完整軌跡及成本,並在公開題庫之外保留內部任務。下一步要看作者是否提供長期版本治理、可重放沙箱及跨代理框架的標準設定。