AI 代理
Qwen-UI-Agent 統一手機、桌面與瀏覽器操作,線上 RL 軌跡超過 100 回合
阿里巴巴 Qwen 團隊公開跨手機、桌面、網頁與 DeepSearch 的 GUI 代理技術報告,以同一動作空間混合畫面操作、CLI 指令及批次動作。模型在多項自報基準領先既有系統,但權重、訓練資料與完整執行框架尚未同步釋出。

Qwen 團隊提出 Qwen-UI-Agent,試圖把目前各自分離的手機控制、桌面操作、瀏覽器任務與深度搜尋整合成一個基礎 GUI 代理。系統不只依賴滑鼠點擊或觸控座標,而是在統一動作空間中交錯產生 GUI 操作與 CLI 指令,並可在一次模型推論中輸出一批動作。這種設計可減少逐步呼叫模型的延遲,也讓代理在適合時直接透過命令列處理檔案或系統狀態。
訓練端結合沙箱與大規模真實手機執行環境。團隊以類似 AutoResearch 的資料迴圈,讓代理生成任務、建立環境、分析失敗,再規劃下一輪資料;線上強化學習則處理超過 100 回合的軌跡,並以逾 10,000 個並行環境加速 rollout。另有輕量 harness 保存跨裝置狀態,使代理能主動啟動服務,而非只能回應單次指令。
報告列出的成績包括 MobileWorld 82.1%、MobileWorld-Real 92.2%、AndroidDaily 97.5%、OSWorld-Verified 79.5%、WebArena 73.6% 與 ScreenSpot-Pro 81.5%。其中 OSWorld-v2 採部分進度評分時為 40.0%,提醒讀者不同基準與評分規則不能直接橫向比較。這項工作對工程團隊的意義在於,GUI 與 CLI 可能不再需要兩套代理,而能共用策略、記憶及長程訓練管線。
目前最主要的限制是技術報告尚未附上可重現的模型權重、訓練集、推論程式與成本資料,成績也主要由開發團隊自行報告。下一步應觀察是否公開實際部署介面、權限隔離與中斷復原機制,以及第三方能否在原版 OSWorld 和真實裝置上重現長任務表現。