GUI 代理
布局匹配取代直接座標生成,GUI 定位在 ScreenSpot-Pro 達 41.3%
北京大學研究者讓多模態模型只負責解讀操作意圖,再由 Text/Icon 候選偵測器與凍結 CLIP 選出點擊區域,ScreenSpot-Pro 準確率由所列最佳基線的 18.9%升至 41.3%。論文所稱「無回歸」只適用於最終匹配階段,候選框偵測器本身仍使用框回歸損失,而且尚未公開實作。

新提出的 Layout-Aware GUI Grounding Model 不讓大型多模態模型直接吐出點擊座標。第一階段以凍結的 Qwen2.5-VL-72B 同時閱讀截圖與指令,把「關閉檔案總管」展開成含文字、外觀及相對位置的視覺描述;第二階段由經 GUI 資料適配的 DINO 偵測器產生 Text 與 Icon 候選框,再以凍結的 CLIP ViT-B/32 計算描述與裁切區域的餘弦相似度,直接選擇最高分候選框。這種解耦讓語言模型處理抽象意圖,專用模型負責像素級辨識,避免把看似合理但不存在的座標當作答案。[論文](https://arxiv.org/abs/2608.09654)另把候選框中心、寬高、長寬比及面積投影成空間偏移,注入 CLIP 特徵,以區分「左上方返回鍵」之類位置敏感指令。
訓練資料來自約二十萬張 GUI 截圖,先由解析工具抽取文字與圖示區域,再用 Qwen3-VL產生區域描述。DINO 以八張 RTX 3090 訓練五十輪;第二階段凍結 CLIP,只訓練單層幾何投影。作者回報 ScreenSpot 平均點擊準確率 87.1%,高於 UGround 的 73.3%;在包含 23 款專業應用、1,581 組指令與標註的 ScreenSpot-Pro 上則為 41.3%,所列最佳基線 OS-Atlas-7B 為 18.9%。[官方基準儲存庫](https://github.com/likaixin2000/screenspot-pro-gui-grounding)可用來核對資料與評測協定。
「hallucination-free」仍應保守理解。系統只是避免最終階段自由生成座標;前面的 DINO 候選產生器仍以 L1、GIoU 與分類損失訓練框位置,若目標沒有進入候選集合,CLIP 無法補救。評測也主要衡量預測點是否落入標註框,不代表多步代理能可靠完成任務。論文未提供程式、模型或新建訓練資料,表格中部分基線數字亦需要獨立重跑;工程團隊下一步應關注候選召回率、額外推論延遲,以及較小的意圖解析模型能否保留相同增益。