AI 安全與模型反學習
ConceptGuardは同一概念の善用と悪用をペアリング、最良条件でも分離スコアはわずか0.38
ConceptGuardは、忘却セットと保持セットを互いに無関係な事実として扱うのではなく、同じ技術の有害な用途を抑制しながら正当な用途を保持するようモデルに求める。4種類のアンラーニング手法はいずれも忘却と有用性のトレードオフを示し、その効果は概念ごとに大きく異なった。

大規模言語モデル(LLM)のアンラーニング評価の多くは、「指定された内容を忘却したか」と「その他の能力を保持しているか」を別々に測定する。しかし、この区分では、サイバーセキュリティ、化学合成、匿名化技術などのデュアルユース知識を扱うことが難しい。そこでConceptGuardは、同じ基盤概念における有害な使用方法と良性の使用方法を相補的なサンプルとしてペアリングし、概念全体を削除するのではなく、意図に応じてモデルが行動を選択的に抑制できるかを直接テストする。
データセットは合計5,166件の事例で構成され、忘却側と保持側に均等に分けられている。頻出するテーマには、サイバーセキュリティ、ソーシャルエンジニアリング、偽情報が含まれる。有害データはLLM-LATから取得し、研究者らはGPT-5を用いてデュアルユース概念を分類するとともに、構造と長さが近い良性の対照データを生成した。構築の3段階すべてに人間による監督が加えられた。評価にはROUGEと質問応答性能に加え、良性のHelpScoreから有害なHarmScoreを差し引くコンテキスト分離指標が使用された。
チームはQwen-2.5-3B-InstructとLlama-3.1-8B-Instructを対象に、gradient ascent、SimNPO、RMU、UNDIALを比較した。gradient ascentは有害な出力を最も強く抑えた一方、QwenのHelpScoreはわずか0.08まで低下した。SimNPOとRMUは有用性をより良好に保持した。LlamaではRMUのコンテキスト分離スコアが最高の0.38を記録したが、HarmScoreは依然として0.21だった。また、匿名化、ソーシャルエンジニアリング、化学合成、自動化などの概念によって各手法の順位が逆転しており、安定したきめ細かな制御にはまだ至っていない。
この結果は、有害な問題に対する正答率が低くても、それはモデル全体の能力が低下しただけである可能性があり、それ単独ではアンラーニングの成功を証明できないことを安全性エンジニアに示している。ただし、データ内の良性の対照サンプルはGPT-5によって合成され、評価ではGPT-5.4が判定役として使用されているうえ、実験対象も2つの比較的小規模なモデルと単一の言語分布に限られている。今後は、人間が作成したデータ、多言語データ、敵対的な言い換え、より大規模なモデルを導入し、コンテキスト分離が汎化できるかを検証する必要がある。