返回首頁

AI 評測

重審五套電腦代理基準:15.3% 的失敗判決其實判錯

研究團隊人工複核 150 條被標為失敗的公開軌跡,發現 10.7% 是評分器假陰性,另有 4.7% 源自不可完成的題目。真正的失敗也主要發生在規劃與結果驗證,而非滑鼠定位或工具執行。

User:Drahreg01 · CC BY-SA 3.0 · Image source
zh-Hant

電腦操作代理的成功率通常被當成能力指標,但新研究指出,這個數字其實混合了代理錯誤、環境失效與評分器限制。團隊從 OSWorld-Verified、WebArena、VisualWebArena、WorkArena 與 AssistantBench 抽取 150 條公開且原先得分為零的軌跡,重新檢查推理文字、操作、畫面與最終狀態。結果有 16 條實際完成任務,卻因答案格式、URL、DOM 或狀態檢查器不接受替代解法而被判失敗;另有 7 條因參考答案過期、搜尋服務故障、CAPTCHA 或虛擬機缺少必要硬體狀態而不可完成。合計 15.3% 的 FAIL 判決有誤,95% Wilson 信賴區間為 10.4% 至 22.0%。

各基準的問題並不相同。WebArena 抽樣中的錯判率為 21.7%,主要是有效答案未通過匹配;AssistantBench 同為 21.7%,但錯誤主要來自網站漂移。OSWorld 的 57 條軌跡中有 8 條有效替代方案未被狀態檢查器辨識,另有兩項壞題;WorkArena 的 24 條樣本則未發現錯判。研究只抽查已被判為失敗的軌跡,因此不能估計成功案例中的假陽性,也不能直接修正各模型的完整排行榜。

團隊再把 122 條真正失敗依最早的決定性原因分類:驗證與回饋問題占 39.3%,其中未察覺操作沒有改變畫面的重複動作就占 29.5%;規劃問題占 35.2%;執行、參數與視覺定位只占 13.9%。這代表工程團隊若只改善 grounding,可能沒有處理主要瓶頸。下一步應保存可重播的截圖、工具回應與狀態轉移,對題目、環境和 grader 分別版本化,並在發布單一成功率前報告壞題、評分器不確定性、成本及失敗類型。

來源

  1. How Benchmarks Mis-Score Computer-Use Agents
  2. OSWorld repository