代理訓練
Echoverse 以可演化應用程式訓練電腦代理,9B 模型跨測試成功率升至 67.1%
Microsoft Research 團隊讓合成應用程式、任務與評分器依代理失敗軌跡共同修正,而非只持續增加靜態網頁數量。9B 模型在 14 組測試的平均成功率由 36.5% 升至 67.1%,但目前只公開四個環境作為基準。

電腦代理需要能被反覆操作、破壞與重設的應用程式來訓練,但許多真實服務受登入、私人資料與狀態限制,促使研究者大量生成替代網站。Microsoft Research 等機構提出 Echoverse,主張瓶頸已不是合成環境數量,而是環境是否具備足夠的行為深度、是否針對代理真正會失敗的互動,以及能否隨模型能力持續演化。
Echoverse 將規格編譯成具後端狀態的應用程式,任務結果直接對照應用資料庫,而非只由視覺或語言模型判斷畫面。每條 rollout 會同時形成兩種回饋:一方面修補應用程式、任務與驗證器,另一方面成為代理的新訓練訊號。這能處理常見的「代理其實完成了,但評分器判錯」或環境過度簡化等問題,也讓訓練分布跟著最新失敗模式移動。
團隊在 12 個環境訓練一款 9B 模型,於 14 組評測的平均成功率由 36.5% 提升至 67.1%。消融實驗顯示,淺層環境甚至讓真實網站準確率由 80% 降至 75%;加入較深狀態與互動後,兩組測試分別由 80% 升至 85%、48% 升至 65%。只修復單一環境,也使在該環境訓練的模型由 16.2% 升至 38.5%。改採結合資料庫驗證器與逐步裁判的強化學習獎勵後,保留測試分數則由 58.8% 升至 68.0%。
這些結果提示,生成大量外觀不同但邏輯單薄的網站可能造成負遷移;工程上更值得投資的是狀態模型、可驗證後端與失敗驅動的課程更新。目前僅四個環境連同種子資料和 grounded grader 對外提供,完整 12 個訓練環境、9B 檢查點及前沿教師成本並未全部公開。後續關鍵是第三方能否重現跨網站轉移,以及共同演化是否會讓代理過度適應評分器漏洞。