返回首頁

LLMOps

Grafana Agent Observability 正式上線,以開源 SDK 串接線上評分與代理 CI

Grafana 將內部使用的代理觀測平台推向正式可用,並公開支援五種語言及多款代理框架的 agento11y SDK。平台把對話、工具執行、成本、OTel traces、線上評分與離線實驗接入同一套回歸流程,但完整產品仍綁定 Grafana Cloud。

Humphrey Bolton · CC BY-SA 2.0 · Image source
zh-Hant

Grafana 在 7 月 30 日宣布 Agent Observability 於 Grafana Cloud 正式可用,試圖把代理監控從「看 token 與延遲」延伸成可進入部署流程的品質控制。其開源 agento11y 儲存庫提供 Go、Python、JavaScript/TypeScript、Java 與 .NET SDK,並附 Anthropic、OpenAI、Gemini 供應商介面,以及 LangChain、LangGraph、OpenAI Agents、LlamaIndex、Google ADK、Strands、LiteLLM、Pydantic AI、Vercel AI SDK 等整合。SDK 以標準 OTLP 輸出 traces 與 metrics,對話及 generation 資料則送往專用 ingest,讓平台關聯版本、成本、工具呼叫與評分。

這次較有技術實質的部分是把線上事故轉回可重跑測試。團隊可對正式流量套用 JSON、正規表示式等確定性檢查,或使用 LLM 裁判評估提示注入、PII、毒性及任務完成度;低分對話可收進 collection、人工標註後加入 test suite。SDK 再以相同案例執行離線 experiments,比較提示詞、模型或工具版本,並可在 pull request 中充當 CI 閘門。若正式環境評分惡化,結果也能轉成 Grafana metrics 與告警,連回造成差異的代理版本。

隱私設計需要特別檢查:應用 SDK 預設傳送完整 generation 訊息,但不傳工具參數與結果;程式代理外掛則預設只傳 metadata。即使如此,企業仍需自行確認提示詞、使用者識別碼、資料保留與跨境傳輸政策。另一項限制是 LLM 裁判本身不穩定,官方也沒有公布 GA 版本對評分準確率、額外延遲或儲存成本的獨立基準。開源的是 SDK 與外掛,對話彙整、評估管理及介面仍依賴 Grafana Cloud。工程團隊接下來應觀察 OTel GenAI 語意慣例的相容性、不同 SDK 的資料一致性,以及 CI 評分能否真正預測正式流量中的回歸。

來源

  1. How to build a trust platform for your agent with Grafana Agent Observability
  2. grafana/agento11y: Grafana Agent Observability SDK