評測/強化學習
OSReward 發現電腦代理評審普遍放過失敗軌跡,視覺證據對判決影響反而有限
OSReward 以 1,019 條人工複核的跨平台軌跡測試 27 款視覺語言評審,發現主要錯誤是把未完成任務判成成功。移除逐步文字使準確率平均下降 7.2 點,改動畫面輸入影響較小,暴露現有「視覺評審」對代理自述的依賴。

電腦使用代理的訓練與排行榜經常把整段螢幕、動作及推理軌跡交給視覺語言模型,再由它判斷任務是否完成。OSReward 將焦點從代理本身轉向這個「評審模型」,建立 1,019 條涵蓋網頁、Windows、Ubuntu 與行動裝置的人工黃金軌跡;每條軌跡由三人獨立標註,意見分裂時再交由兩名資深審查者討論,而不是直接多數決。
研究在固定協定下測試 27 款 VLM。完整集合上的最佳二元準確率接近 90%,但模型普遍寬鬆:所有系列最常見的錯誤,都是接受代理其實沒有完成的任務。此類「錯判成功」佔全部錯誤約三分之二,數量超過錯判失敗三倍。到了刻意集中爭議案例的 OSReward-Hard,可靠度進一步下降;能維持約 70% 的雲端評審,完整評一次資料集需約 45 至 100 美元。
更值得注意的是輸入消融。刪除逐步思考與動作文字,準確率平均降低 7.2 個百分點,並翻轉 22.7% 判決;改變看似關鍵的畫面配置,彙總準確率變化較小。這表示評審常從代理的文字敘事推測成功,而非確認最終介面狀態。即使把前三名評審做多數決,提升也只有約 1 點,因為它們往往在相同困難樣本上一起犯錯。
團隊另建立 OS-Shepherd-100K,並以 Qwen3.5 為底座訓練 9B、35B 獎勵模型,主打在較低成本下接近商業評審。不過論文仍標示為進行中,專案頁也稱程式、資料與權重正在釋出;部分成本敘述在摘要與專案頁之間口徑不同。工程團隊現階段更應把評審視為會偏誤的量測元件,保留環境狀態驗證、失敗抽查與分平台校準,而不是直接把單一 VLM 判決當成強化學習真值。