GUI 代理/世界模型
AppDeltaWorld 以可執行 HTML 預測手機介面,MobileGym 成功率由 10.2% 升至 14.1%
AppDeltaWorld 不直接生成下一張螢幕截圖,而是先檢索動作可達的版面,再產生 HTML 差分並補入合成圖片。它能建立封閉迴圈訓練軌跡,但目前成效仍依賴自建評分與未公開的完整實作。

AppDeltaWorld 嘗試解決手機 GUI 代理缺少可安全反覆操作之訓練環境的問題。與直接預測像素或文字描述不同,它把下一個介面表示成可由瀏覽器執行的 HTML 更新:系統先把目前畫面定位到應用程式內的介面群組,再依點擊、長按或滑動的目標查詢動作轉移索引,只從歷史上可到達的候選畫面檢索 Level-1 HTML 骨架;模型其後生成包含實際文字、元件與位置的 Level-2 HTML。
對難以用程式碼表達的商品圖或影片縮圖,系統保留 image slot,再以擴散模型生成素材,最後交由瀏覽器渲染。這種文字、程式碼與影像混合設計,目標是同時減少自由生成造成的版面漂移、密集文字錯誤及不可能的狀態跳轉。若轉移索引找不到與目前狀態和動作相符的目標群組,系統可拒絕或降低該次預測的可信度。
作者以 100,149 個 GUI 轉移步驟訓練世界模型,並從 GUI-Owl、OpenMobile 種子建立 33,133 條 AppDelta 軌跡。CMGUIBench-500 的綜合分為 73.51,略高於 GPT-Image-2 的 72.34;其中 AppDeltaWorld 的元件與版面分數較高,但功能邏輯分數並未全面領先。將合成軌跡加入監督微調後,AppDeltaAgent 在 MobileGym 的成功率由 Qwen3-VL-8B 基線 10.2% 升至 14.1%,MobileWorld 的純 GUI 成功率則由 9.4% 升至 14.9%。
技術價值不只在生成畫面,而是讓模型能在同一世界模型內連續行動、過濾失敗轉移,再把留下的軌跡用於 SFT 或測試期強化學習。不過,73.51 的綜合分混合 Gemini 裁判、SigLIP、DINOv2 與版面指標,未必等同真實應用程式的因果一致性;平均輸出亦達 8,309 token,高於多數純程式碼基線。工程團隊接下來應關注完整程式、索引建置工具與模型權重是否釋出,以及在介面更新、登入狀態和伺服器端副作用下能否維持轉移正確性。