返回首頁

代理評測

OmegaUse-OfficeVal 為辦公代理加入逐任務成本標籤,最佳模型品質仍落後人類逾三分之一

百度研究團隊公開 100 項長流程文件、試算表與簡報任務,並附上人工工時、價格代理值及可執行驗證器。最佳模型平均得分為 17.91,人類基線為 27.79,說明推論便宜且快速仍不等於交付物可直接使用。

N509FZ · CC BY-SA 4.0 · Image source
zh-Hant

7 月 29 日公開的 OmegaUse-OfficeVal,嘗試把辦公代理評測從「是否按到正確按鈕」移向「交付物品質是否值得付費」。資料集收錄 100 項由實務工作需求改寫的長流程任務,輸入共含 220 個 DOCX、PPTX、XLSX、PDF、圖片與影音檔,要求產生 115 個可編輯成品。每項任務平均需要人工工作 2.32 小時,中位數 2.03 小時,最長達 8.35 小時。

基準為每項任務附上人工完成時間及價格代理值。約兩成價格來自實務提供者的外包經驗,其餘由三位專家估算;全體平均價格為 6.86 美元。評分不限制代理使用 GUI、程式或混合路徑,而是檢查最終檔案。研究團隊把細分規則轉成 219 項可用性檢查與 2,009 項完成度檢查;檔案只要無法開啟、編輯或使用,整項分數便歸零,其他錯誤則按修復負擔扣分。

在固定代理框架下,GLM-5.2、Kimi K2.6、DeepSeek-V4-Pro、MiniMax M3 與 Qwen3.7-Plus 都比人工更快、更便宜,但最佳平均分僅 17.91,對照每題取最佳人工成品的 27.79。值得注意的是,平均分最高的模型未必在價格較高的任務取得最多價值,代表部署方不能只用宏平均挑模型。

這套基準的工程價值在於完整公開輸入、規則、驗證器與經濟標籤,可用來測量模型升級是否真的減少人工返工。不過任務經過去識別化及重建,價格多為專家估值,人工基線又選取每題最佳作品,均會影響解讀。下一步應觀察驗證器能否抵抗針對性取巧,以及結果能否在不同辦公軟體、語言和地區薪資下重現。

來源

  1. OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
  2. OmegaUse-OfficeVal project website