返回首頁

AI 評測與安全

Canary Tools 將代理選錯工具拆成六類,八款模型受騙率相差約 36 倍

新評測在 MCP 工具清單植入語意誘餌、參數陷阱與能力幻象等定向探針,藉錯誤呼叫定位代理的選擇弱點。11,520 次實驗顯示模型等級不能穩定預測安全性,而受騙後能否自行退出,會把任務成功率由 16% 拉升至 52%。

Farid mernissi · CC BY-SA 4.0 · Image source
zh-Hant

一般工具代理評測只能指出「呼叫錯誤」,卻無法分辨模型是只看工具名稱、忽略必要參數,還是被誇大的能力描述吸引。Canary Tools 因此在正常 MCP 工具旁加入六類刻意設計的錯誤選項:語意誘餌、不可滿足的參數陷阱、能力幻象、隱藏前置條件、過期版本及粒度不符。每個探針只改動工具契約的一個面向,代理一旦選中,錯誤便可對應至較明確的推理弱點。

研究以五個 MCP 伺服器、12 個真實風格工具及 120 項任務測試八款模型。主實驗涵蓋三種 canary 密度與三個工具排序種子,共 8,640 次執行;另有 2,880 次弱化提示線索的消融實驗。宣告條件下,每題 canary susceptibility rate 從 Claude Opus 4.8 的 0.010 到 Llama 3.1 8B 的 0.378,相差約 36 倍。值得注意的是,能力層級未能排出安全順序:GPT-4.1 的 0.311 高於三款前沿模型,Gemini 2.5 Flash 的 0.041 也略低於 Gemini 2.5 Pro 的 0.049。

不同探針揭露的失敗亦不相同。託管模型最常被「研究級、能力更強」等能力幻象吸引;兩款 8B 開放模型則會同時踩中過期資料、參數不可用及粒度錯配。受騙率與任務成功呈負相關,Spearman ρ 為 -0.34;在全部 1,313 次已受騙執行中,能改呼叫正確工具者成功率為 52%,未恢復者只有 16%。

這項方法適合加入模型升級或 MCP 工具變更前的回歸測試。MCP 規格本身也提醒客戶端不要預設工具註記可信,並建議保留人工確認與呼叫日誌。不過實驗使用合成工具輸出及 LLM 裁判,且 arXiv 頁面尚未列出所稱已釋出框架與日誌的公開儲存庫;在真實權限、延遲及不可逆操作下的診斷效度仍待驗證。

來源

  1. Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools
  2. Model Context Protocol — Tools specification