返回首頁

AI 代理評測

ComponentBench 拆解 2,910 項網頁操作,同一代理因介面模式相差逾 34 個百分點

ComponentBench 不以完整工作流程掩蓋錯誤,而是逐一測試滑桿、日期選擇器、資料表與拖放等 UI 元件。GPT-5 mini 在相同任務及框架下,使用 accessibility tree 與純座標像素操作的成功率分別為 83.1% 和 48.9%。

Palauenc05 · CC BY-SA 4.0 · Image source
zh-Hant

新公開的 ComponentBench 把電腦操作代理的評測單位縮小至單一 UI 元件,填補「點擊座標」等原子測試與數十步完整工作流程之間的空白。完整版本包含 2,910 項任務、97 種標準元件及 14 個互動家族,涵蓋按鈕群組、日期時間輸入、富文字編輯器、資料表、滑桿及跨區拖放;元件來自 Ant Design、MUI、Mantine 等實際 React 函式庫,而非靜態截圖。

每題都有程式化成功條件和經清理的人類操作軌跡。評測器只在 DOM 進入指定狀態時判定通過,不採信代理自行回報的「完成」,也不依賴另一個 LLM 裁判。研究團隊並公開任務 YAML、JSON Schema、執行框架、逐步紀錄、截圖和失敗案例,讓開發者能追查問題究竟出在視覺辨識、目標定位、操作選擇、狀態確認或過早終止。

七款模型在四種觀察/操作介面上的結果顯示,代理外殼與介面表示法足以改變模型排名。GPT-5 mini 在 accessibility tree 模式成功率為 83.1%,改用只憑像素和座標控制後降至 48.9%;Qwen3-VL-235B 亦由 AX-tree 的 77.0% 降至 Pixel 的 50.5%。完整榜首是 Gemini 3 Flash 搭配 Browser-Use,通過率 95.2%,但即使最快配置仍需人類參考時間的 3.7 倍。拖放、高精度連續輸入與進階編輯器是最困難的元件家族。

這表示採購或微調電腦操作模型時,單一總分不足以預測產品表現;DOM、accessibility tree、標記截圖與純視覺模式其實是不同系統設計。限制是任務仍以短程 React 網頁互動為主,無法涵蓋登入、網路延遲、跨頁狀態及長流程錯誤累積。後續值得觀察精簡但更困難的 912 題 Core 版本能否維持版本穩定,以及公開軌跡能否促成針對拖放與狀態驗證的訓練改進。

來源

  1. ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents
  2. ComponentBench project site
  3. TianchenGuan/ComponentBench
  4. ComponentBench dataset and raw runs