返回首頁

AI 代理評測

ORCA-bench 重建六天遙測現場,前沿代理的中等難度根因分析最高僅 25.3%

ORCA-bench 以可運行的微服務、50 GB 遙測資料與 1,079 起事故,測試程式代理能否從模糊通報找出根因。即使提供完整原始碼,最佳代理在貼近真實輸入的中等難度任務也只答對四分之一。

David Stanley from Nanaimo, Canada · CC BY 2.0 · Image source
zh-Hant

新公布的 ORCA-bench 把代理評測從「修補已定位的程式錯誤」推進到更接近值班工程師的根因分析。測試環境是一套持續運行、具 OpenTelemetry 儀表化的微服務系統;代理可經 Grafana 使用 Prometheus 指標、Jaeger traces 與 OpenSearch logs,並檢查完整原始碼。資料涵蓋六天、約 50 GB,共建立 1,079 項根因分析任務,刻意改變事故通報的明確程度、偵測延遲及同時發生的故障數量。

結果顯示,能寫程式不等於能可靠處理事故。五款前沿代理中,最佳者在代表較真實通報的 Medium 分組只有 25.3% RCA Accuracy,Hard 分組降至 10.0%;最弱模型更在 40% 的事故報告中虛構不合理根因。移除原始碼存取後,所有衡量項目都惡化,說明遙測搜尋仍不足以取代從執行現象回溯實作的能力。

研究以 SRE 人工確認症狀真值,並重新人工評分 LLM 裁判結果,報告加權 Cohen’s κ 為 0.90,讓評測比單純自動裁判更可信。不過每項事故仍被隔離調查,系統規模也遠小於真實生產環境,因此 25.3% 很可能是樂觀上限,而不是部署門檻。

對平台團隊而言,下一步不應只是換更大的模型,而是測試代理能否建立時間線、交叉核對 metrics、logs、traces 與版本變更,並在證據不足時停止下結論。任何自動修復流程也應把根因假設、查詢紀錄和變更批准拆開,避免低準確率診斷直接觸發生產操作。

來源

  1. ORCA-bench: How Ready Are Language Model Agents for Oncall?
  2. OpenTelemetry Documentation