AI 代理與評測
Echoverse、リセット可能なステートフルWebサイトでコンピューター操作エージェントを訓練——9Bモデルの評価スコアが67.1%に上昇
MicrosoftのEchoverseは、大量の表層的なWebサイト複製を追求するのではなく、データベース状態、因果的な結果、検証可能なタスクを備えた合成アプリケーションを構築する。12の環境で訓練した結果、9Bモデルは14のテスト分割全体で36.5%から67.1%に向上したが、公開版に含まれるのはそのうち4環境のみだ。

コンピューター操作エージェントは、クリックやデータ入力を繰り返し、結果を観察し、失敗から学ぶ必要がある。しかし、実在するWebサイトでは、ログイン、プライバシー、データの変動、取り消せない操作などの制約を受けることが多い。Microsoftの研究チームが7月30日に公開したEchoverseは、訓練単位を「Webサイトのように見えるページ」から、リセット可能なステートフルアプリケーションへと転換した。各環境は、FastAPIバックエンド、Vite/Reactフロントエンド、SQLiteの状態、タスク、そしてデータベース上の結果に基づいて採点するverifierで構成される。
Echoverseは、環境を2種類に分類している。フルドメイン環境は、共有スレッド、権限、監査ログ、書き込み操作の結果といった長期的な因果構造を保持する。一方、能力環境では、多様なレイアウト上で日付ピッカーやネストされたフィルターなど、単一のコントロールを繰り返し訓練する。後者には、未見のコンポーネントファミリーとレイアウトも用意されており、エージェントが汎用的な操作能力を習得したのか、それとも特定の画面を記憶しただけなのかを区別できる。
また、このシステムはモデルと環境を共進化ループに組み込む。各rolloutの採点結果は、一方ではタスク、環境、verifierの修正に利用され、もう一方では次のラウンドにおける教師あり学習または強化学習のシグナルとなる。論文によると、9Bモデルを12の環境で訓練したところ、14の評価分割全体でスコアが36.5%から67.1%に上昇した。データベース検証とステップ単位の評価を組み合わせた報酬を使用すると、ホールドアウトテストのスコアは58.8%から68.0%へ向上した。表層的な環境では、実在Webサイトでの精度が80%から75%に低下することさえあり、合成データは量を増やすだけでは転移性能を保証できないことが示された。
公開リポジトリはMIT Licenseを採用しているが、リリースされたのはEchoStay、EchoForge、日付ピッカー、ネストされたフィルターの4環境のみで、合計6分割、722タスクとなっている。完全な実験で使用された12環境すべては公開されていない。書き込みタスクはデータベースの差分を比較する一方、テキスト回答は引き続きOpenAI API互換のLLM judgeによって処理されるため、評価は完全に決定論的ではない。今後エンジニアリングチームは、未公開の環境、訓練軌跡、モデル更新が追加公開されるか、また外部のエージェントが論文で示された実在Webサイトへの転移効果を再現できるかを注視すべきだ。