返回首頁

AI 代理與瀏覽器自動化

Wuying Browser Agent 以錯誤恢復資料訓練長流程操作,27B 模型在 BrowserBench 達 65.1%

阿里雲團隊把瀏覽器代理的錯誤恢復、複雜 UI 操作與長程信用分配納入同一訓練流程。27B 模型在新建的中英雙語 BrowserBench 取得 65.1% Pass@1,但模型權重與評測資料的公開可得性仍待確認。

Fooksou Lamimo · CC BY-SA 4.0 · Image source
zh-Hant

阿里雲 AI Model Application & Engineering 團隊提出 Wuying-Browser-Agent,重點不是單純放大模型,而是針對真實網站的長流程失敗模式重新設計執行、資料與強化學習。其瀏覽器 harness 提供 24 種結構化操作,按目前 DOM、歷史動作及環境回饋重建每一步的決策上下文,避免把已失效的頁面狀態持續堆進對話紀錄;所有訓練與評測則運行於隔離的 AgentBay 瀏覽器環境。

第一階段 RUIC-SFT 混合一般成功軌跡、日期選擇器與富文字編輯器等複雜元件資料,以及「犯錯—察覺—反思—修正」軌跡。論文指出,只用一般監督資料的模型對已偵測錯誤僅有 8.5% 恢復率。第二階段 DAO-GRPO 以進度獎勵補足稀疏的任務終點分數,並比較同一任務多條 rollout 的分歧點,把較大權重放在真正改變成敗的分支,而不是平均更新整條共享前綴。

團隊同時建立 BrowserBench:350 項中英雙語真實網站任務,涵蓋 254 個網站,平均需要 37.9 步,最長允許 100 步。Wuying-Browser-Agent-27B 報告 WebVoyager、Online-Mind2Web 與 BrowserBench 成功率分別為 80.6%、66.7% 與 65.1%;用於回報估計的裁判在抽查 500 條軌跡時,與人工判斷一致率為 96.4%。

工程價值在於把恢復能力視為可訓練目標,並讓 SFT、線上 RL 與部署共用相同工具協定。不過 BrowserBench 近半數題目屬電商資訊,成功判定亦部分依賴與訓練獎勵同系列的裁判;網站持續變動也會影響重跑結果。論文宣稱釋出 4B、9B、27B 模型,但截至截稿時尚應確認權重、資料與完整評測程式是否已公開,才足以獨立驗證其「開源最佳」主張。

來源

  1. Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents
  2. browser-use:論文評測框架所基於的開源瀏覽器代理工具
  3. Wuying AgentBay SDK