ホームへ戻る

AI 安全/模型對齊

境界認識型自己蒸留がLLMの誤拒否範囲を縮小、ただし安全性向上と過剰拒否のせめぎ合いは続く

新たな研究は、安全ポリシーをトピック内の細粒度な拒否境界としてモデル化し、対になったプロンプトと補完データを用いることで、モデルがセンシティブなトピック全体を遮断するのを防ぐ。Qwen3-8Bを用いた実験では、境界付近の誤拒否を大幅に削減できたが、結果は依然として政治的説得、単一の主要モデル、完全には公開されていないデータパイプラインに限定されている。

Ambrosius Bosschaert · Public domain · Image source
zh-Hant

Multiverse Computingのチームは、大規模言語モデルの安全性アライメントを「狭い境界」の問題として捉え直した。デプロイ担当者が通常求めるのは、モデルに政治、サイバーセキュリティ、医療といったトピック全体への回答を拒否させることではなく、その中でポリシーに違反する意図だけを拒否させることだ。例えば、モデルは選挙制度に関する質問には回答すべきだが、特定の集団を標的とした操作的メッセージを作成してはならない。トピック分類だけに依存するguard modelでは、この違いを表現するのは難しい。

研究では、Qwen3-8Bと政治的説得を主要なテスト環境とし、オフラインの自己生成パイプラインを構築した。モデルがまず拒否軌跡を生成し、その後、安全性モデルが検証する。1回のsteeringで適格な拒否が生成されなかった場合、システムは段階的に強度を上げる再試行、移植、または長さ制御によってデータカバレッジを補完する。1回だけの生成では、監査対象プロンプトの19.88%が取りこぼされたが、段階的な再試行により、そのギャップは0.20%まで縮小した。ただし、こうした拒否データだけを追加すると、安全境界が外側へ拡大する可能性もある。

この副作用は顕著だった。Escalateで完成させた拒否データを用いて学習すると、対象となる政治関連プロンプトの拒否率は9.47%から84.75%へ上昇し、3つの広範な有害性評価における平均的な安全でない応答率は26.26%から0.14%へ低下した。その一方で、XSTestが安全なプロンプトについて測定した過剰拒否率は2%から74%へ上昇した。このため研究では、対象モデル自身が生成・検証した準拠応答に加え、共通のトピックアンカーを持ち、意図だけが異なる有害/良性プロンプトのペアを導入した。

あるペア比較によるアブレーションでは、境界データによって良性側の誤拒否率が32.94%から4.16%へ低下する一方、有害側の拒否率は91.88%から87.72%へわずかに低下した。これは、安全性チームがjailbreak成功率だけを追跡すべきではないことを示している。データカバレッジ、良性プロンプトへの準拠率、境界両側での再現率と適合率も、モデルを本番投入する際の指標に含めるべきだ。

ただし、論文の主要な結果は、単一のトピック、Qwen3-8B、固定されたLoRA設定から得られたものであり、一部の比較ではデータの重複が不完全で、モデルのrevisionも固定されていない。データセットと生成コードは、将来的に安全性研究に用途を限定する条件で公開される予定にとどまり、WildGuardとLlamaGuardによる評価のカバレッジも完全ではない。そのため現時点では、この手法が日本語圏や他のリスクポリシーへそのまま汎化できるとは想定できない。

出典

  1. Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
  2. Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal