代理安全
StepGuard 在工具執行前審查代理動作,但每項任務增加約 2.53 秒推論
上海人工智能實驗室等團隊發布 4B 參數 StepGuard,以成對的安全/危險軌跡和 Balance-GRPO 校準過度攔截與漏攔截。它在兩項代理環境大幅降低攻擊成功率,但訓練語料及資料生成器尚未公開,對規範性違規亦仍會漏判。

多數代理防護模型檢查提示詞、回覆或已完成的整段軌跡;若危險步驟是寄出檔案、修改網路政策或執行交易,事後判定已無法撤回工具副作用。StepGuard 把判斷點移到每次工具呼叫之前,輸入當前軌跡與候選動作,輸出安全標籤、風險類型及危險步驟,同一個 4B 模型也可用於離線軌跡稽核。
其 StepGen 管線先建立共用相同前綴、只在關鍵動作分歧的安全與危險軌跡,並加入外觀相似但正當的工具重用案例,避免模型只看到某個工具名稱便封鎖。冷啟動監督微調後,Balance-GRPO 會依每批 rollout 中安全與危險樣本的準確率差距重加權 advantage,把訓練資源移向目前較弱的一類。消融實驗顯示,相較標準 GRPO,其整體準確率/F1 由 81.5/81.9 升至 82.2/82.1,兩類準確率差距由 13.0 降至 8.0。
以同一 Qwen3.6-35B-A3B 代理測試時,StepGuard 在 AgentDojo 的攻擊成功率為 1.2、效用為 90.7;AgentDyn 則為 9.3 與 66.7。團隊概括為相對無防護配置平均降低 77.3% 攻擊成功率,效用下降 2.8 個百分點。代價並非免費:全面檢查每次呼叫時,單次防護平均需 599.9 毫秒、產生 195.5 token;每項任務平均檢查 4.22 次,合計約 2.53 秒及 825 token。
模型權重與評估程式已公開,但 7,000 筆訓練集及 StepGen 仍待發布,外界目前無法完整重建資料品質與教師偏差。作者分析的 575 個錯誤亦顯示,它較擅長工具介導的技術傷害,卻可能漏掉冒名提交作業等制度或規範性違規。工程團隊應把它視為額外的風險分類器,而不是取代權限隔離、人工核准及可回滾工具設計的安全邊界。