AI 安全/代理系統
SafeKeep 發現工具 schema 會削弱模型拒答訊號,提示注入成功率降至 2.5%
新研究指出,代理使用的 JSON 式工具規格不只是中性介面,還可能壓低模型內部的拒答表徵。SafeKeep 在執行前另以攤平的文字規格判斷安全性,將有害要求平均拒答率由 23.8% 提高至 70.6%。

工具呼叫通常被視為把模型輸出轉成結構化參數的工程層,但 SafeKeep 團隊發現,光是把工具能力寫成 schema 格式,就可能改變模型的安全行為。研究以白箱隱藏狀態分析比較一般聊天提示與代理提示,觀察到加入工具規格後,模型內部原有的拒答方向變弱;把 schema 的語意換成無意義文字、或拆解代理提示的不同組件後,結構本身仍是造成安全性下降的重要因素。
團隊提出的 SafeKeep 不修改實際工具介面,而是把安全判斷與執行分成兩條路徑:判斷器先讀取由 JSON 攤平成自然語言的工具描述,確認請求是否應拒絕;通過後,執行模型仍使用原始 schema 產生合法工具呼叫。這避免為了安全檢查而破壞參數約束,也能放在既有代理框架的推論前端。
在兩項基準、四款白箱與黑箱模型上的自報結果顯示,有害要求平均拒答率由 23.8% 升至 70.6%,觀察內容層級提示注入的平均攻擊成功率則由 25.6% 降至 2.5%。公開程式包含 400 組成對請求、表徵方向抽取、因果介入與端到端示範,並特別鎖定 Transformers 版本,因為聊天模板的工具渲染方式本身就是受測變因。
這項結果提醒代理開發者,安全回歸測試必須涵蓋實際工具 schema、模板版本與序列化格式,不能只測裸模型。不過,目前程式庫規模很小,主要白箱重現使用 Llama 3.1 8B Instruct 與 Qwen2.5 7B Instruct;拒答增加是否會在大型生產工具集造成誤擋、額外延遲或判斷器繞過,仍待獨立驗證。