返回首頁

AI 代理治理與評測

Microsoft 依模型、平台與應用重整 AI 標準,代理治理轉向執行期介入

Microsoft 將 Responsible AI Standard 改成按技術堆疊與自身角色套用核心及情境要求。配套工具以可執行評測、無狀態政策判定與工作流程介入點,把代理治理從部署前文件延伸至持續控制。

Dietmar Rabich · CC BY-SA 4.0 · Image source
zh-Hant

Microsoft 在 2026 年 Responsible AI Transparency Report 中披露,已重新設計內部 Responsible AI Standard。新版不再只把 AI 系統視為單一產品,而是依模型、平台服務與應用程式三層,以及 Microsoft 在各層扮演開發者或部署者的角色,組合永久適用的核心要求與可隨能力、用途及法規更新的情境要求。[Microsoft 公告](https://blogs.microsoft.com/on-the-issues/2026/09/01/responsible-ai-in-2026-how-we-are-adapting-for-whats-ahead/)特別把具高階網路攻擊能力的系統,以及能保存記憶、使用工具、讀取資料和代替使用者行動的代理列為加強管理對象。

對工程團隊而言,關鍵變化是控制位置由模型輸出擴大到整條代理執行鏈:代理身分、工具權限、動作監測與人工升級都成為治理物件。Microsoft 同時把 ASSERT、RAMPART 與 Agent Control Specification(ACS)列為落地工具。RAMPART 將紅隊發現編成 pytest 可重跑的安全回歸測試;ACS 則在每個介入點接收完整 JSON 狀態快照,以無狀態、確定性且 fail-closed 的政策引擎回傳 allow、warn、deny、escalate 或 transform。[ACS 0.3.1-beta 規格](https://github.com/microsoft/agent-governance-toolkit/blob/main/policy-engine/spec/SPECIFICATION.md)也要求驗證轉換後的動作,而非只記錄政策宣告。

這種設計可讓同一政策跨不同代理框架執行,並把提示注入、越權工具調用與未經批准的資料存取轉成 CI 測試及執行期決策。報告也指出 Microsoft 正與 MLCommons 擴充 AILuminate;現有基準以危害分類、越獄攻擊與「Resilience Gap」量化受攻擊後的安全退化。[MLCommons 說明](https://mlcommons.org/ailuminate/jailbreak/)顯示,受測 39 個模型的越獄分數均未追平原始安全評級。

限制同樣明確:透明度報告主要是 Microsoft 自我揭露,沒有逐項公布內部標準的通過率或事故基線;ACS 仍是草案,API 與 manifest 可能在正式版前變動。AILuminate 的部分評測仍以單輪、有限語言及內容安全為主,無法完整代表長任務代理。部署者下一步應驗證政策引擎中斷時的預設行為、快照是否遺漏外部狀態,以及 transform 或人工升級是否能在重試與並行工具呼叫下保持一致。

來源

  1. Responsible AI in 2026: How we are adapting for what’s ahead
  2. Agent Control Specification 0.3.1-beta
  3. AILuminate Jailbreak