代理訓練
Echoverse、進化可能なアプリでコンピューターエージェントを訓練――9Bモデルのテスト横断成功率が67.1%に向上
Microsoft Researchのチームは、静的なWebページを増やし続けるのではなく、エージェントの失敗軌跡に基づいて合成アプリケーション、タスク、評価器を連動して修正する。9Bモデルは14の評価セットにおける平均成功率を36.5%から67.1%へ伸ばしたが、現時点でベンチマークとして公開されている環境は4つのみだ。

コンピューターエージェントの訓練には、繰り返し操作し、壊し、リセットできるアプリケーションが必要だ。しかし、多くの実サービスにはログイン、個人データ、状態に関する制約があるため、研究者は代替Webサイトを大量に生成してきた。Microsoft Researchなどの研究機関が提案したEchoverseは、ボトルネックはもはや合成環境の数ではなく、環境に十分な行動上の深さがあるか、エージェントが実際に失敗するインタラクションを対象としているか、そしてモデルの能力に応じて継続的に進化できるかどうかだと主張する。
Echoverseは仕様を、バックエンド状態を持つアプリケーションへコンパイルする。タスクの結果は画面を視覚モデルや言語モデルだけで判定するのではなく、アプリケーションのデータベースと直接照合される。各rolloutからは同時に2種類のフィードバックが生成される。一方はアプリケーション、タスク、validatorの修正に使われ、もう一方はエージェントの新たな訓練シグナルとなる。これにより、「エージェントは実際にはタスクを完了しているのにgraderが誤判定する」といった一般的な問題や、環境が過度に単純化されている問題に対処できるほか、最新の失敗パターンに追随して訓練分布を変化させられる。
チームは12の環境で9Bモデルを訓練し、14の評価セットにおける平均成功率を36.5%から67.1%へ向上させた。アブレーション実験では、浅い環境によって実Webサイトでの精度が80%から75%へ低下することさえあった。より深い状態とインタラクションを追加すると、2つのテストセットの成績はそれぞれ80%から85%、48%から65%へ向上した。単一の環境だけを修復した場合でも、その環境で訓練したモデルの成績は16.2%から38.5%へ上昇した。さらに、データベースvalidatorとステップ単位のjudgeを組み合わせた強化学習報酬へ切り替えると、保留テストのスコアは58.8%から68.0%へ向上した。
これらの結果は、外観は異なっていてもロジックが薄いWebサイトを大量に生成すると、negative transferを引き起こす可能性があることを示唆している。エンジニアリング面でより投資価値が高いのは、状態モデル、検証可能なバックエンド、失敗駆動型のカリキュラム更新だ。現時点では、seedデータおよびgrounded graderとともに公開されている環境は4つだけであり、12の訓練環境の完全版、9B checkpoint、frontier teacherのコストはすべて公開されているわけではない。今後の焦点は、第三者がWebサイト間のtransferを再現できるか、そして共進化によってエージェントがgraderの抜け穴へ過剰適応しないかどうかだ。