AI 安全與評測
コンプライアンス検出器、ルールを与えても主に文脈を読み、交差ルールテストではほぼランダムに
新たな研究により、複数のguard modelとactivation probeは、ルールを削除、シャッフル、置換しても判定精度がほとんど変わらないことが分かった。テキスト上のショートカットを排除するために設計された交差テストでは、高速な検出器の成績はランダムに近く、ルールと文脈を組み合わせる能力が明確に回復したのは、段階的推論モデルだけだった。

研究では、デプロイ型guard model、内部activation probe、zero-shot judge、policy-conditioned modelを調べ、コンプライアンスを判定する際に、問題文で提示されたルールを実際に使用しているかを検証した。中核となる反実仮想操作は単純だ。同じ文脈を固定したまま、ルールを削除またはシャッフルするか、別分野のルール、さらには結論が逆になるルールへ置き換え、判定が変化するかを観察した。その結果、正しいルールを与えたICS probeの平均AUROCは0.9519だった。一方、ルールを削除、シャッフル、または誤った分野のルールに置き換えた後も約0.955となり、20分野のいずれでも有意な低下は見られなかった。
著者らは、この現象を「rule blindness(ルール盲点)」と呼んでいる。固定された分類体系を使用するLlama Guard 3とQwen3Guardは、もともと任意のルールを入力として受け付けない。さらに注目すべきは、カスタムポリシー用の入力チャネルを備え、関連条文を引用することさえできるLatent Policy Guardも、ポリシーを置き換えても判定がほとんど変わらなかった点だ。これは、モデルが「違反事例らしいテキスト」を識別している一方で、指定されたルールの下でその文脈が実際に違反に当たるかを計算していない可能性を示している。
データのラベルを文脈内の語彙から直接推測できるという問題を排除するため、研究チームはさらに、8分野にわたる200組の2×2ケースを構築した。閾値または役割だけを入れ替えた2つのルールと、表面的に類似した2つの文脈を組み合わせ、4通りの組み合わせでラベルが相互に反転するようにした。凍結されたICS、logistic regression、MLP、Llama Guard 3、Qwen3Guard、single-token judgeはいずれもおおむね0.50 AUROCにとどまり、4ケースすべてに正解する割合は大半がゼロだった。Qwen3-8B MLPを再学習しても、AUROCは0.670、全問正解率は11%にすぎなかった。同じLlama-3.1-8Bを段階的推論に切り替えると、40組のサブサンプルにおけるAUROCは0.849まで上昇し、4ケースすべての正解率は74.4%に達した。
エンジニアリング上の含意は、安全性分類器をそのまま法規制エンジンとして扱うことはできない、という点だ。ポリシーが地域、顧客、バージョンによって切り替わる場合、評価には「文脈は同じで、ルールだけを反転させる」ペアケースを組み込み、ランキング能力、閾値のキャリブレーション、真のルール合成能力を個別に測定する必要がある。この研究はまだ査読を受けていないプレプリントであり、段階的推論の結果はより小規模なサブサンプルのみを使用している。また、著者らが提案した低コストのICSも、事前登録された包括的な優越性基準を満たしておらず、適応的なwhite-box attackによって破られる可能性がある。