返回首頁

AI 代理

Qwen-UI-Agent 統一手機、桌面與瀏覽器操作,長軌跡訓練擴至逾百步

Qwen 團隊提出跨手機、桌面、網頁與深度搜尋環境的統一 GUI 代理,並讓畫面操作與 CLI 指令共用同一動作空間。技術報告宣稱其在 OSWorld-Verified 達 79.5%,但模型權重、訓練資料與完整軌跡尚未公開。

猫猫的日记本 · CC BY-SA 4.0 · Image source
zh-Hant

Qwen-UI-Agent 的重點不是再增加一套滑鼠點擊模型,而是嘗試把原本分散的手機操作、桌面軟體、瀏覽器任務與 DeepSearch 收斂成單一基礎代理。模型可以在同一軌跡中交錯輸出 GUI 動作與 CLI 指令,也能一次產生一批動作,減少每個點擊都必須重新呼叫模型的延遲。系統另以輕量 harness 保存跨裝置狀態,支援由代理主動啟動服務,而非只能被動回應指令。

訓練端採用類似 AutoResearch 的資料飛輪:代理自行建立任務與沙箱、診斷失敗,再據此規劃下一輪資料生成。線上強化學習可處理超過 100 回合的軌跡,官方稱 rollout 基礎設施能同時運行逾一萬個環境。這項設計顯示,GUI 代理的擴展瓶頸正從單步視覺定位,轉向可重設環境、長程信用分配及失敗資料回收。

報告列出的成績包括 MobileWorld 82.1%、MobileWorld-Real 92.2%、AndroidDaily 97.5%、WebArena 73.6%,以及 OSWorld-Verified 79.5%;在較新的 OSWorld-v2 則只報告 40.0% 的部分進度分數。工程團隊解讀這些數字時應特別注意評分口徑:OSWorld 的執行結果會受虛擬機映像、帳戶與 OAuth 設定、網站防爬措施及代理最大步數影響,官方榜單也要求提交實作或監控軌跡才能驗證。

目前最大的限制是技術報告先於可重現資產出現:論文沒有同步提供權重、完整訓練集、部署程式或逐任務軌跡,因此與封閉前沿模型的比較仍屬團隊自測。接下來應觀察模型是否公開、批次動作在畫面狀態改變時如何中止,以及跨 GUI/CLI 權限是否具有細粒度隔離與人工確認機制。

來源

  1. Qwen-UI-Agent Technical Report
  2. OSWorld benchmark repository and verification requirements