返回首頁

軟體代理與評測

ASIL 以結構化狀態取代螢幕點擊,軟體代理成功率由 6.6%升至 81.6%

ASIL 讓代理讀取 JSON 軟體狀態,再透過檔案解析器、原生腳本或服務 API 執行語意動作。它在 380 項任務顯著超越螢幕控制,但比較同時改變了代理可見資訊與操作粒度,不能單純解讀為模型能力提升。

Nikolai Ahlbrecht · CC BY-SA 2.0 de · Image source
zh-Hant

上海交通大學研究人員提出 Agent-Software Interaction Layer(ASIL),主張軟體代理不應被迫模仿人類觀看螢幕、換算座標再點擊。ASIL 改以結構化 JSON 暴露文件、物件及服務狀態,並讓模型輸出可驗證的語意動作;執行層依應用程式選擇最深且可審查的存取路徑,包括解析開放文件格式、呼叫 Blender 或 GIMP 等軟體的原生腳本,以及橋接 REST、WebSocket、桌面服務或檔案系統。動作在執行前接受 schema 檢查,結果則由應用程式狀態評估器驗證。

團隊為 LibreOffice、Blender、GIMP、JupyterLab、Gitea、Thunderbird、OBS 等 15 款軟體建立轉接器,評測包含 300 項單一應用及 80 項跨應用任務。在相同任務、初始檔案與最終狀態評分器下,Kimi K2.5 的整體分數為 84.8;GPT-5.4 使用 ASIL、最多 15 個步驟時得 81.6,而修復後的螢幕控制即使放寬至 50 步也只有 6.6。Sonnet 4.6 的對應結果為 81.2 與 26.6,ASIL 平均每項任務少於五個語意動作。結構化軌跡亦能用於後訓練:Qwen3.5-9B 從 66.6 提升至 SFT 的 80.4,再經評估器回饋的線上 RL 達 82.2。

這些數字主要證明介面契約的重要性,而不是 ASIL 在所有情況都優於成熟原生 API。它對 LibreOffice 的成績領先 UNO API,但在 draw.io 僅與既有 MCP 內容介面相當;結構化狀態也可能隱藏畫面布局、渲染錯誤或使用者實際可見內容。程式、轉接器、任務及模型權重已公開,但訓練實作、逐任務軌跡與分數未隨版本庫釋出。後續值得檢查轉接器維護成本、跨版本穩定性、最小權限設計,以及同一代理同時使用結構化狀態與視覺畫面時能否兼顧可靠性與介面真實性。

來源

  1. ASIL: Replacing Screenshot-and-Click with Structured State and Semantic Actions
  2. ASIL — Agent-Software Interaction Layer
  3. Official ASIL implementation