代理評測/可觀測性
AFANet 以 6.5 萬可訓練參數診斷多代理故障,域內推論由 199 秒縮至 1.16 秒
AFANet 把代理對話轉成含時間及同代理連線的圖,再以兩層 GCN 判斷故障代理與錯誤類型。它在 AEGIS-Bench 勝過多款 LLM 基線,但跨資料集的代理—錯誤配對 F1 仍偏低。

多代理系統失敗後,常見做法是把完整軌跡交給另一個 LLM,要求它找出哪個代理犯了哪類錯誤。新研究提出 AFANet,主張這類診斷更接近結構化分類問題,未必需要昂貴的生成式推理。
AFANet 把每輪對話建成節點,加入相鄰輪次的雙向時間邊,以及同一代理不同發言間的長距離邊。節點特徵包含位置與偏差等統計訊號,也包含 all-MiniLM-L6-v2 產生的句子向量;兩層 GCN 完成訊息傳遞後,再把每個代理的節點作平均及最大池化,分別最佳化「代理是否故障」與「錯誤類型」兩項損失。
在作為域內資料的 AEGIS-Bench,AFANet 的代理層 micro-F1 為 74.16%、代理—錯誤配對 micro-F1 為 17.42%;後者高於論文測試的 Qwen、GPT-4.1、o3、Gemini 2.5 與 Claude Sonnet 4 基線。模型只有約 6.5 萬個可訓練參數,V100 上訓練需 1.1 小時,域內/域外推論分別為 1.16/0.37 秒;論文列出的 7B SFT 基線則需 6 小時訓練及 199/108 秒推論。
效率數字需審慎解讀:6.5 萬參數不包括凍結的句子編碼器,另有約 80.8 秒圖建構預處理。更重要的是,模型只以 AEGIS-Bench 訓練;移到 Who&When 後,代理層 micro-F1 降至 37.93%,配對 micro-F1 僅 6.90%,顯示錯誤分類仍難以跨資料分布泛化。消融結果亦顯示,移除 GNN 後域內差距不大、域外退化較明顯。下一步應觀察作者是否釋出完整實作,以及能否在自然發生、而非人工整理或注入的生產故障軌跡上重現速度與準確率。