返回首頁

AI 安全/模型對齊

邊界感知自我蒸餾縮小 LLM 誤拒範圍,但安全增益仍與過度拒絕拉鋸

新研究把安全政策建模為主題內的細粒度拒絕邊界,並用成對提示與補償資料避免模型封鎖整個敏感主題。Qwen3-8B 實驗顯示方法可大幅降低邊界附近的誤拒,但結果仍限於政治說服、單一主要模型與未完全公開的資料管線。

Ambrosius Bosschaert · Public domain · Image source
zh-Hant

Multiverse Computing 團隊將大型語言模型的安全對齊重新表述為「窄邊界」問題:部署者通常不是要模型拒答整個政治、資安或醫療主題,而是只拒絕其中違反政策的意圖。例如模型應回答選舉制度問題,卻不能撰寫針對特定族群的操弄訊息;只靠主題分類的 guard model 很難表達這種差異。

研究以 Qwen3-8B 和政治說服為主要測試場景,建立離線自我生成流程。模型先生成拒絕軌跡,再由安全模型驗證;若單次 steering 未產生合格拒絕,系統以逐步升級的重試、移植或長度控制修補資料覆蓋。單次生成會遺漏 19.88% 的受稽核提示,升級重試把缺口降至 0.20%,但若只加入這些拒絕資料,安全邊界也可能向外擴張。

這個副作用相當明顯:以 Escalate 完成的拒絕資料訓練後,目標政治提示拒絕率由 9.47% 升至 84.75%,三項廣泛危害評測的平均不安全回覆率由 26.26% 降至 0.14%;同時,XSTest 對安全提示測得的過度拒絕卻由 2% 升至 74%。研究因此加入由目標模型自行生成並驗證的合規回覆,以及共享主題錨點、只改變意圖的有害/良性提示對。

在一項配對消融中,邊界資料把良性一側的誤拒率由 32.94% 降至 4.16%,有害一側的拒絕率則由 91.88% 小幅降至 87.72%。這表示安全團隊不能只追蹤 jailbreak 成功率;資料覆蓋、良性合規率及邊界兩側的召回與精確度都應成為模型上線指標。

不過,論文的主要結果來自單一主題、Qwen3-8B 與固定 LoRA 設定,部分比較的資料重疊不完整,模型 revision 也未鎖定。資料集與生成程式預計日後才以限安全研究的條款發布,WildGuard 與 LlamaGuard 的評分覆蓋亦不完全,因此目前尚不能假定方法可直接泛化至中文語境或其他風險政策。

來源

  1. Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
  2. Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal