ホームへ戻る

AI 代理與瀏覽器自動化

Wuying Browser Agent、エラー回復データで長期的な操作フローを訓練——27BモデルがBrowserBenchで65.1%を達成

Alibaba Cloudチームは、ブラウザエージェントのエラー回復、複雑なUI操作、長期的な信用割当を単一の訓練パイプラインに統合した。27Bモデルは、新たに構築された中国語・英語バイリンガルのBrowserBenchでPass@1 65.1%を達成したが、モデルの重みと評価データが一般公開されているかどうかは、依然として確認が必要だ。

Fooksou Lamimo · CC BY-SA 4.0 · Image source
zh-Hant

Alibaba CloudのAI Model Application & Engineeringチームは、Wuying-Browser-Agentを発表した。重点は単なるモデルのスケールアップではなく、実在するWebサイトにおける長期的な操作フローの失敗パターンを踏まえ、実行、データ、強化学習を再設計することにある。そのブラウザharnessは24種類の構造化アクションを提供し、現在のDOM、過去のアクション、環境からのフィードバックに基づいて各ステップの意思決定コンテキストを再構築する。これにより、すでに無効となったページ状態が会話履歴に蓄積され続けることを防ぐ。訓練と評価はすべて、隔離されたAgentBayブラウザ環境で実行される。

第1段階のRUIC-SFTでは、一般的な成功軌跡、日付ピッカーやリッチテキストエディターなどの複雑なコンポーネントに関するデータ、さらに「ミス—検知—内省—修正」の軌跡を混合する。論文によると、一般的な教師ありデータのみで訓練したモデルは、検知済みエラーからの回復率がわずか8.5%だった。第2段階のDAO-GRPOでは、進捗報酬によって疎なタスク終端スコアを補完する。また、同一タスクに対する複数のrolloutの分岐点を比較し、共有プレフィックス全体を一様に更新するのではなく、実際に成否を左右した分岐により大きな重みを割り当てる。

チームは同時にBrowserBenchも構築した。これは254の実在するWebサイトを対象とした350件の中国語・英語バイリンガルタスクで構成され、平均37.9ステップを要し、最大100ステップまで許容する。Wuying-Browser-Agent-27Bが報告したWebVoyager、Online-Mind2Web、BrowserBenchでの成功率は、それぞれ80.6%、66.7%、65.1%だった。結果報告の推定に使用されたjudgeは、500件の軌跡を抜き取り検査した際、人間による判定と96.4%の一致率を示した。

エンジニアリング上の価値は、回復能力を訓練可能な目標として扱い、SFT、オンラインRL、デプロイメントで同一のツールプロトコルを共有している点にある。一方、BrowserBenchのタスクの約半数はEコマース情報に関するものであり、成功判定の一部は訓練報酬と同系列のjudgeに依存している。Webサイトが継続的に変化することも、再実行時の結果に影響を及ぼす。論文は4B、9B、27Bモデルを公開したとしているが、独立した検証に十分なモデルの重み、データ、完全な評価コードが実際に公開されているかどうかは、執筆時点でなお確認が必要であり、それを経て初めて「オープンソースで最高性能」という主張を検証できる。

出典

  1. Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents
  2. browser-use:論文評測框架所基於的開源瀏覽器代理工具
  3. Wuying AgentBay SDK