返回首頁

代理資料集與評測

Cohere ATE 對照近 70 萬個 MCP 工具與職業任務,僅 2.6% 被判定可端到端完成

Cohere Labs 公開 Agentic Task Ecosystem,彙整七個目錄的 696,291 個工具,再與美國 O*NET 工作任務對照。結果顯示大量 MCP 只完成流程片段,但 2.6% 是語意配對與模型判定結果,不能視為工具通過實際執行測試。

Daniel sebit · CC BY-SA 4.0 · Image source
zh-Hant

Cohere Labs 於 9 月 3 日發布 Agentic Task Ecosystem(ATE),把 2026 年 5 月從七個公開目錄收集的 696,291 個工具、123,069 個 MCP 伺服器整理成可下載的 Parquet 資料。團隊先跨目錄去重,再替每個工具尋找最相近的美國 O*NET 任務敘述,並要求語言模型把配對分成完整執行、只支援部分步驟或錯誤配對。資料集同時保留工具名稱、描述、職業與 SOC 代碼、餘弦相似度、判定理由及品質標籤,方便研究者重新過濾。

依其嚴格定義,只有 2.6% 工具被判定能從頭到尾完成一項 O*NET 任務;純查詢資料、傳送訊息或處理單一步驟者不算完整自動化。成功配對涵蓋 1,380 種任務敘述,約佔可由軟體執行任務的 15%;923 種職業中有 419 種完全沒有對應工具。理論上的 AI 暴露程度與實際 MCP 覆蓋量在 178 種職業間呈 0.54 相關,但工具數量無法說明它們觸及的是例行工作還是專業核心。

這套資料的重要性在於提供代理工具供給面的可查詢快照,可用來研究 MCP 生態重複建設、能力缺口或職業分布。然而,它沒有下載量、實際部署、成功率、安全性或長週期任務測試;工具描述也可能誇大實作。最近鄰檢索加語言模型判定仍會產生牽強配對,人工驗證亦只涵蓋部分分類。對工程與研究團隊而言,下一步應是加入可執行的 MCP 合規測試、版本與使用遙測,並建立中文及其他地區的職業任務本體;否則 2.6% 只能解讀為特定分類規則下的供給指標,而不是代理已能取代多少工作。

來源

  1. Automation’s Early Footprint: Where AI Agents Are (and Aren’t) Being Built
  2. Agentic Task Ecosystem dataset