AI 安全與評測
合規偵測器即使收到規則仍主要閱讀情境,交叉規則測試幾乎降至隨機
新研究發現,多款 guard model 與 activation probe 刪除、打亂或替換規則後,判斷準確率幾乎不變。專為排除文字捷徑而建的交叉測試中,快速偵測器接近隨機,只有逐步推理模型明顯恢復規則與情境的組合能力。

研究檢查部署式 guard model、內部 activation probe、零樣本裁判與政策條件式模型,測試它們判斷合規時究竟有沒有使用題目提供的規則。核心反事實操作很直接:固定同一情境,刪除規則、打亂規則,或換成其他領域乃至結論相反的規則,再觀察判斷是否改變。結果顯示,ICS probe 在正確規則下的平均 AUROC 為 0.9519;移除、打亂或換錯領域規則後反而約為 0.955,20 個領域均沒有顯著下降。
作者稱此現象為「規則盲點」。固定分類體系的 Llama Guard 3、Qwen3Guard 本來就不接收任意規則;更值得注意的是,具自訂政策輸入通道、甚至能引用相關條文的 Latent Policy Guard,替換政策後也很少改變裁決。這表示模型可能辨認「像違規事件的文字」,卻沒有計算該情境在指定規則下是否真的違規。
為排除資料標籤可由情境詞彙直接猜出的問題,團隊另建八個領域、200 組四格案例:兩條只交換門檻或角色的規則,配上兩個表面相近情境,使四種組合的標籤互相翻轉。凍結的 ICS、邏輯回歸、MLP、Llama Guard 3、Qwen3Guard 與單 token 裁判大致落在 0.50 AUROC,四格全對率多為零;Qwen3-8B MLP 重新訓練後也只有 0.670 AUROC、11% 全對率。相同 Llama-3.1-8B 改為逐步推理後,40 組子樣本的 AUROC 升至 0.849,四格全對率達 74.4%。
工程上的含義是,安全分類器不能直接當作法規引擎。若政策會按地區、客戶或版本切換,評測必須加入「情境不變、規則翻轉」的配對案例,並分開量度排序能力、閾值校準與真正的規則組合能力。研究仍是未經同儕審查的預印本;逐步推理結果只用較小子樣本,而作者提出的低成本 ICS 也未通過其預先註冊的全面優越性門檻,且可被自適應白箱攻擊破壞。