AI 代理與評測
Echoverse 以可重設的狀態式網站訓練電腦代理,9B 模型評測升至 67.1%
微軟的 Echoverse 不再追求大量淺層網站複製品,而是建立具資料庫狀態、因果後果與可驗證任務的合成應用。以十二個環境訓練後,9B 模型跨十四個測試切分由 36.5% 提升至 67.1%,但公開版本只包含其中四個環境。

電腦操作代理需要反覆點擊、寫入資料、觀察後果並從失敗中學習,但真實網站常受登入、隱私、資料變動與不可逆操作限制。微軟研究團隊 7 月 30 日公開 Echoverse,把訓練單位從「看起來像網站的頁面」改成可重設的狀態式應用:每個環境包含 FastAPI 後端、Vite/React 前端、SQLite 狀態、任務及依據資料庫結果判分的驗證器。
Echoverse 區分兩類環境。完整領域環境保留共享討論串、權限、稽核紀錄與寫入後果等長程因果結構;能力環境則在大量版面中反覆訓練日期選擇器、巢狀篩選等單一控制元件。後者另設未見過的元件家族與布局,藉此區分代理學到一般操作能力,還是記住特定畫面。
系統也把模型與環境放進共同演進迴圈。每次 rollout 的判分結果一方面用來修復任務、環境及 verifier,另一方面成為下一輪監督或強化學習訊號。論文稱,9B 模型在十二個環境訓練後,跨十四個評測切分由 36.5% 升至 67.1%;使用結合資料庫驗證與逐步評審的獎勵時,保留測試分數由 58.8% 升至 68.0%。淺層環境甚至會使真實網站準確率由 80% 降至 75%,顯示合成資料數量本身不足以保證遷移。
公開儲存庫採 MIT 授權,但只釋出 EchoStay、EchoForge、日期選擇器及巢狀篩選器四個環境,合計六個切分、722 項任務;完整實驗使用的十二個環境並未全部公開。寫入任務會比較資料庫差異,文字答案仍由相容 OpenAI API 的 LLM judge 處理,因此評分並非完全確定性。工程團隊接下來應觀察未公開環境、訓練軌跡與模型更新是否補齊,以及外部代理能否重現論文所稱的真實網站遷移收益。