返回首頁

AI 評測與開發工具

LiveEvalBench 讓代理實際建置與操作網頁,取代只比對前端截圖的靜態評測

LiveEvalBench 以建置、程式碼及瀏覽器操作三類代理蒐集證據,再依每個作品實際功能產生檢查項目。框架與資料已公開,但評分仍依賴 LLM 裁判,成本、可重現性及裁判偏差需要進一步量化。

Attributed to John Taylor · Public domain · Image source
zh-Hant

生成式前端模型已能輸出完整專案,但常見評測仍偏重截圖相似度、靜態程式碼或少量固定測試。這些方法容易漏掉「畫面正確但按鈕無效」、相依套件無法安裝、路由失敗或狀態更新錯誤;反過來,與參考截圖不同但功能正確的實作也可能被錯判。

8 月 4 日公開的 LiveEvalBench 把評測改造成一套代理式審查流程。Build Engineer 先建立與啟動專案,Code Engineer 檢查實作及結構,UI Tester 則透過 Playwright 在 Chromium 中操作頁面。各角色不是只輸出主觀分數,而是從建置紀錄、原始碼和實際互動蒐集證據,再交由共同評分流程整理。框架保留跨模型共用的 rubric,同時依個別作品實際宣稱的功能形成實作導向檢查,試圖兼顧可比較性與前端解法的多樣性。

公開儲存庫提供 Python 執行器、四個核心代理設定、評分模板、斷點續跑、JSONL 分片與結果儀表板;可連接 Anthropic、OpenAI、Google 或 OpenAI 相容端點。預設每個代理最多執行 80 個 ReAct 步驟,單筆任務逾時上限為 5,400 秒,也支援多程序分片。基準資料另放在 Hugging Face,方便更新任務而不必重寫整條評測管線。

技術價值在於把「網站能否真正使用」納入模型比較,也可作為企業驗收 AI 產生前端的起點。不過論文僅表示結果與人類專家判斷高度一致,摘要未提供足以獨立判讀的完整一致性數字;自適應檢查又由模型產生,可能讓不同裁判模型得到不同排名。下一步應觀察固定版本容器、網路隔離、token 與執行成本報告,以及在不同裁判模型下的排名穩定度。

來源

  1. LiveEvalBench: Toward Open-World Evaluation for Web Generation
  2. LiveEvalBench source code and documentation
  3. LiveEvalBench dataset