AI 安全
MostarGate 以三層權限交集縮小代理憑證,600 題資料集先暴露企業政策缺口
新研究把代理可用權限取角色上限、任務分類及禁止組合三者的交集,避免每項工作都持有完整角色憑證。公開資料集將 600 個企業任務映射至 15 類最小權限,但 93% 改善反映的是政策修訂,不是已部署系統的攻擊攔截率。

MostarGate 研究針對企業代理常見的「靜態全配」問題:代理在啟動時取得某個角色可能用到的全部工具與憑證,即使當前工作只是摘要文件,也可能保有資料庫、外部郵件或 HTTP 權限。作者提出三來源架構,最終權限取三者交集:由角色或服務身分設定不可突破的上限;由獨立的任務情境分類器預測當次工作需要哪些工具;最後以確定性政策移除危險的權限組合。
第三層特別處理間接提示注入的「致命三角」:同時接觸私有資料、不受信任內容及外部通訊。示例政策禁止 `database_read` 與 `http_request` 或 `email_send_external` 同時出現。分類器不接受代理自行申報權限,編排器只部署通過三層判斷的憑證;系統也可先以 observe-only 模式運作,保留完整角色權限但記錄原本會被拒絕的工具呼叫,類似 SELinux 的 permissive 部署方式。
公開的 GPL-3.0 資料集包含六個虛構部門、600 個任務提示,以及 GitHub、Jira、Slack、資料庫、外部郵件等 15 類最小權限標籤。提示生成與權限標記分成兩次模型呼叫,以降低生成文字直接洩漏標籤邏輯的循環性;60 筆、688 個人工覆核決策的 Cohen’s kappa 在爭議處理後為 0.967。資料生成亦找出原政策的 46 個角色上限衝突,修訂後降至 3 個。
這個 93% 降幅不能解讀為攔截 93% 攻擊:它只量測合成任務與修訂政策之間的上限衝突。完整分類器尚未接受對抗性提示、真實企業工作流或效用損失評測,論文也明確假設分類器、憑證服務與編排器可信。下一步關鍵是量測權限漏給與少給、分類延遲,以及任務途中需求改變時的安全升權流程。