AI 代理/可靠性
AgentTrajectorySentinel 以微秒級時序監控攔截代理失控,實測任務成功率由 52% 升至 73%
新研究不再讓第二個 LLM 逐步審查代理,而是從工具動作、延遲、輸出與 token 機率等遙測偵測軌跡偏移。系統成本約每步 200 微秒,但每個部署仍須以自身的正常軌跡重新校準。

LLM 代理在多步任務中可能反覆呼叫工具、沿錯誤結果繼續推進,或在完成前偏離目標;若每一步都交由另一個大型模型判讀,不但延遲與費用接近再執行一次代理,裁判本身也可能誤判。8 月 3 日公開的 AgentTrajectorySentinel 改以輕量時序模型監看執行中的可觀測訊號,再把警報接到回滾與重試流程。
監控器把每一步表示成語意嵌入、token log-probability 統計,以及動作類型、延遲、輸出長度和錯誤旗標等中介資料。核心是只用正常軌跡訓練的 echo-state network,搭配 CUSUM 累積偏移偵測器;不同訊號通道各自評分,任一通道越過門檻即可觸發警報。對於可精確驗證的工作,系統另加入確定性檢查,例如從代理真正收到的工具結果重新計算總額、確認必要呼叫均已執行,避免完全依賴統計異常。
作者在三種代理框架、三款本地模型與 Gemini 2.5 Flash 上整理了 2,823 條軌跡。主要監控器在 5% 假警報預算下偵測到 71% 的失敗,AUROC 為 0.872;在預訂代理的回滾重跑實驗中,45% 的失敗獲得修復,隨機重抽樣對照僅 16%,整體成功率則由 52% 提高至 73%。每一步中位處理時間約 200 微秒,模型狀態約 4 MB。
限制同樣重要:監控器跨資料集可以保留排序能力,卻不能直接搬用警報基準;未重新校準時 AUROC 只剩 0.527。短軌跡也可能在異常形成可辨識模式前就結束,而文字內容錯誤通常比行為型失控難抓。工程團隊因此應把它視為低成本的第一層閘門,搭配業務不變量、權限限制與少量高成本裁判,而不是代理正確性的完整證明。程式、固定依賴、資料卡與重現命令已公開,但成果目前仍來自單一作者的預印本,尚待獨立重現。