代理評測
MobilePA-Bench 執行 1,705 項狀態式手機任務,最佳規劃器仍僅得 75.52%
阿里巴巴 MAI 團隊以可變應用程式資料庫、權限錯誤及工具依賴測試手機中央規劃代理,不再只比對靜態 function call。最佳模型在直接工具使用較強,但記憶套用與跨代理協作仍明顯落後。

MobilePA-Bench 把手機代理評測從「JSON 是否匹配答案」推進到可執行的狀態轉移。其模擬環境涵蓋 1,705 項任務、212 個工具、13 個功能領域;每次工具呼叫都會修改應用程式資料、裝置狀態或權限,並把缺少參數、`PermissionDenied`、實體歧義等結果傳回規劃器。評分器依任務檢查精確工具與參數、允許多條路徑的終端狀態、必要呼叫次序,或交給專用子代理時的路由與 handoff 內容。
任務分為 1,040 項基本工具使用、376 項記憶使用、200 項 Skill 使用及 89 項子代理協作。GUI 操作被視為可委派的下游能力,因此基準主要隔離中央規劃器能否選擇 API、套用個人偏好、載入複合流程並處理執行期回饋;它不是像 AndroidWorld 那樣直接測量視覺定位與點擊準確率。
13 個受測模型中,Claude Opus 5 的加權總分最高,為 75.52%;其基本工具與 Skill 分數分別是 83.85% 和 78.00%,記憶使用卻只有 58.51%。各欄最佳者並非同一模型:Qwen 3.8 Max 的記憶分數為 64.63%,Gemini 3.1 Pro 的子代理協作達 77.53%,顯示直接 function calling、個人化 grounding 與委派能力不能互相替代。錯誤分析亦發現,模型碰到權限或限制時,常過早生成不存在或無效的工具呼叫,而非追問或重規劃。
公開狀態仍有一個重要落差。論文宣稱完整任務、資料與高吞吐沙盒均已開源,但截至 8 月 27 日,Apache-2.0 GitHub 儲存庫只有網站、README 與授權檔,Hugging Face 也沒有連結資料集;公開頁面展示的只是示例,真正查詢與 ground truth 留在私人評測服務。工程團隊目前可參考其驗證設計與排行榜,尚不能從公開成品完整重跑 75.52% 結果;下一步應觀察沙盒、任務版本及可重現設定是否實際釋出。