AI 安全與模型反學習
ConceptGuard 配對同一概念的善惡用途,最佳情境分離分數僅 0.38
ConceptGuard 不再把忘卻集與保留集視為互不相關的事實,而是要求模型抑制同一技術的有害用途並保留正當用途。四種反學習方法均出現遺忘與效用取捨,且不同概念間的效果高度不一致。

多數大型語言模型反學習評測會分別測量「指定內容是否忘掉」及「其他能力是否保留」,但這種切法難以處理資安、化學合成或匿名技術等雙重用途知識。ConceptGuard 因而把同一底層概念的有害及良性使用方式配成互補樣本,直接測試模型能否依意圖選擇性抑制行為,而非把整個概念一併刪除。
資料集共有 5,166 個實例,平均分成忘卻與保留兩側;高頻主題包括資安、社交工程及假訊息。有害資料取自 LLM-LAT,研究者用 GPT-5 分類雙重用途概念並生成結構、長度相近的良性對照,三個建構階段均加入人工監督。評分同時使用 ROUGE、問答表現,以及以良性 HelpScore 減去有害 HarmScore 的情境分離指標。
團隊在 Qwen-2.5-3B-Instruct 與 Llama-3.1-8B-Instruct 上比較梯度上升、SimNPO、RMU 與 UNDIAL。梯度上升最能壓低有害輸出,卻令 Qwen 的 HelpScore 只剩 0.08;SimNPO 與 RMU 較能保留效用。在 Llama 上,RMU 的情境分離分數最高為 0.38,但 HarmScore 仍有 0.21;不同方法在匿名、社交工程、化學合成及自動化等概念的排名也會翻轉,尚未形成穩定的細粒度控制。
這項結果提醒安全工程師,低有害題準確率可能只是模型整體能力被壓低,不能單獨證明反學習成功。不過資料中的良性對照由 GPT-5 合成,評估又使用 GPT-5.4 作裁判,而且實驗只涵蓋兩個較小模型與單一語言分布;下一步仍需加入真人撰寫、多語言、對抗改寫及更大模型,驗證情境分離能否泛化。