返回首頁

代理評測

OSReward 檢驗 27 款電腦代理裁判,困難軌跡暴露普遍「誤判成功」偏差

OSReward 以 1,019 條跨 Web、Windows、Ubuntu 與行動平台的人工標註軌跡,測試視覺語言模型能否正確判斷電腦代理是否完成任務。團隊同時公開 10 萬筆推理式判決資料,並訓練可自架的 9B、35B OS-Shepherd 獎勵模型。

Circle of Bramantino · Public domain · Image source
zh-Hant

電腦使用代理的訓練與評測,正逐漸把視覺語言模型當成自動裁判:模型讀取畫面、操作、文字歷史與推理軌跡,再判斷任務是否成功。OSReward 指出,這個關鍵獎勵訊號過去缺乏獨立校準;若裁判把失敗軌跡判成成功,錯誤資料便可能直接進入篩選、強化學習及排行榜。

研究團隊因此自行建立跨 Web、Windows、Ubuntu 與行動裝置的執行環境,收集 1,019 條由四類代理產生的軌跡。每條軌跡由三名標註者判決,意見不一致時再複核,整體約投入 800 小時人工。除了完整測試集,OSReward-Hard 集中保留難例,OSReward-Multi 則分別評估任務對齊與執行效率。固定協定下的 27 款 VLM 裁判呈現共同的寬鬆偏差:真正失敗的執行較容易被接受;在一般集合看似接近九成的總體表現,進入難例後明顯下滑。分析還顯示,判決訊號往往主要來自文字操作歷史,而非最後畫面,代表代理只要留下看似合理的敘述,就可能掩蓋環境其實未達目標。

團隊進一步從自建 rollout 與四套公開軌跡資料產生 321,631 個集成判決,整理出含裁判推理的 OS-Shepherd-100K,並據此訓練 9B、35B 開放獎勵模型。這為無法持續負擔商用前沿裁判的團隊提供可自架基線,但仍不應取代確定性驗證器:檔案是否建立、設定是否寫入或交易是否完成,能直接查環境狀態時仍應以程式驗證。另一項需留意的問題是,論文摘要稱成本低 30% 至 60%,專案頁卻寫成低 30 至 60 倍;在作者釐清計費假設前,不宜引用後者作採購依據。

來源

  1. OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
  2. OSReward and OS-Shepherd project page