返回首頁

代理評測

CTBench 用 234 個電信故障沙箱重測代理,最佳根因分析正確率僅 47.62%

CTBench 要求代理查詢真實設備風格的介面,並按專家指定的證據步驟評估根因分析與路徑還原。最佳組合雖把路徑還原正確率推至 87.96%,根因分析仍只有 47.62%,且取得的關鍵證據更少。

Rambo.XIV · CC BY-SA 3.0 · Image source
zh-Hant

華為與倫敦瑪麗王后大學研究者公開 CTBench,把電信維運評測由靜態問答改成可互動的故障診斷。資料集包含 126 項根因分析(RCA)及 108 項路徑還原任務,由 15 名資深電信專家根據實際案例抽象、去敏,再交由未看答案的獨立專家重做。代理只能使用每題允許的診斷介面,查詢設備狀態、路由、介面、隧道及政策輸出。

評分不只檢查最後答案。RCA 被拆成故障節點/物件定位、標準化原因標籤及證據覆蓋率;路徑題則分別計算端點定位、轉送邊集合 IoU 與證據 F1。每題還標記可觀測性、供應商與設備異質性、協定複雜度、故障傳播深度及專家解法長度,方便區分「猜對結果」與真正完成診斷。

五組代理—模型組合中,Codex+GPT‑5.5 的整體結果最高:路徑題正確率為 87.96%,端點定位達 99.38%,路徑 IoU 為 95.28%;但路徑證據分數只有 47.84%。RCA 落差更大,最終正確率為 47.62%,原因辨識為 66.83%,故障位置為 52.90%,證據分數卻僅 15.80%。這表示代理可能從症狀推中故障類型,卻沒有查到足以授權修復的設備證據。

局部可觀測與多廠牌環境進一步放大問題。以 ClaudeCode+Qwen3.7‑Plus 為例,高異質性路徑題的正確率由 29.31%降至 4.00%;部分可觀測 RCA 雖收集更多間接證據,原因辨識仍由 42.92%降至 16.22%。工程團隊應關注下一步能否把證據規劃、跨廠牌輸出正規化及安全修復納入代理迴路。目前基準只涵蓋 RCA 與路徑重建,尚未測試實際改動網路;資料頁公開但下載需同意分享聯絡資料,也會增加獨立重現門檻。

來源

  1. CTBench: Evaluating Troubleshooting Capabilities of AI Agents in Realistic Telecom Network Operations
  2. netop/CTBench Dataset Card