代理安全與執行期授權
CAGE 為代理工具回傳加入聯合授權證明,避免欄位綁錯與數值漂移共同繞過閘門
CAGE 不只檢查代理當下看到的工具回傳,而是驗證一組可能的正確綁定結果是否全都允許同一動作。研究證明,分別檢查類別欄位與數值誤差並不能保證兩者同時變動時仍安全。

工具型代理通常把 MCP 或 API 回傳解析成具型別紀錄,再由權限閘門判斷後續動作能否執行。CAGE 指出,現行做法多半只驗證眼前的「回傳—動作」組合;若來源標籤綁錯、資料過期或數值在容許誤差內漂移,閘門仍可能放行實際上不符合政策的交易。
研究把工具回傳拆成來源與類別欄位,以及連續數值欄位。威脅模型允許一次可接受的離散綁定錯誤,再加上有界數值偏移。關鍵結果是兩種邊際證明不能直接組合:某個動作可能分別通過「只換來源」與「只改數值」的檢查,卻在來源與數值一起改變時越過另一套政策門檻。例如同一風險分數在信用檢查與制裁篩查下可有不同批准標準。
CAGE 因此先完整列舉離散鄰域,再為每條分支驗證連續擾動。若授權政策本身可執行,CAGE-Exact 直接證明政策;否則 CAGE-Lip 使用 1-Lipschitz 閘門,CAGE-RS 則以 randomized smoothing 建立證明,但兩者只能證明學得的分類器,還必須另外量測它與真實政策的一致性。超出證明範圍的案例會拒絕自動執行並交給人工處理。
作者在合成資料、OPA/Rego policy-as-code、監管規則與真實交易資料轉接器上測試,宣稱消除擾動預算內的 false allow,同時保留部分自主決策。程式庫提供表格對應指令、CPU 快速測試及 Kubernetes、Kyverno、MCP 測試框架,便於核對結果。不過其保證取決於錯誤鄰域是否涵蓋部署現場;它也不處理提示注入或惡意文字,只保護已驗證的型別回傳。下一步應觀察真實系統的綁定錯誤率、人工接管比例及大型 schema 的列舉成本。