返回首頁

AI 評測與開發工具

DashArena 要求模型附上可重播操作軌跡,揭露儀表板「能顯示但不能用」的落差

DashArena 以 234 項開放式任務評測模型生成的互動資料儀表板,並用瀏覽器實際重播模型自行撰寫的操作流程。加入互動證據後,8B 視覺評審與人類偏好的一致率由 71.7%升至 79.8%,但最佳模型仍只有 73.3%的完整重播率。

Master Sgt. Mark Olsen · Public domain · Image source
zh-Hant

生成式模型已能從資料表與自然語言要求產生儀表板,但「頁面成功載入」並不代表篩選器、圖表連動或分析流程真的可用。[DashArena](https://arxiv.org/abs/2608.10567)把評測單位從靜態截圖擴充為「單一 HTML 儀表板加可執行操作軌跡」:模型完成頁面後,還須以 JSON 列出點擊、輸入、選取圖表標記及預期視覺變化。Playwright 執行器在 Chromium 重播每一步,比對控制項、文字與 ECharts 執行期資料,再把截圖和執行收據交給視覺語言模型做成對比較。

基準包含 234 項、14 個主題群的任務;主要排行榜使用其中120項未進入評審模型訓練的任務。研究者以 Claude Opus 4.6 產生偏好標籤,再用510筆交換候選順序後的資料,對 Qwen3-VL-8B-Instruct 進行 LoRA 微調,得到 DashJudge-8B。它在99組具人類多數意見的比較上達79.8%一致率,原始模型為70.7%;移除操作軌跡及執行報告後則降至71.7%。只靠能否渲染、重播及元件是否變動等規則,一致率僅42.4%,顯示語意品質不能由瀏覽器測試單獨判定。

工程上更值得注意的是可靠性落差。GPT-5.5雖居偏好排行榜首位,渲染率仍只有85.8%,完整重播率73.3%;所有受測模型均未突破86%與74%。這說明生成式前端評測應同時保存可重播測試、執行證據及語意判斷,而非只截圖打分。[Apache ECharts](https://echarts.apache.org/en/)提供多種 Canvas/SVG 互動圖表,亦是此基準限制候選使用的圖表介面。後續應觀察作者是否完整公開任務、執行器與權重,以及自撰軌跡會否遺漏模型不願展示的失敗路徑;目前單條軌跡的平均控制項涵蓋率只有80.8%。

來源

  1. DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation
  2. Apache ECharts