AI 安全與代理系統
VLAがエージェントの隠れ状態通信を監視、同一モデルによるオークション試験でAUROC 0.993
新たな研究では、エージェント間で受け渡されながら対話ログには記録されない連続ベクトルと、その後の公開行動を同一イベントに紐付け、異常検知、反実仮想的影響、スパース特徴の3層で検査する。平均0.993という結果には、テキストによる共謀と潜在状態による共謀の両方のサンプルが含まれ、攻撃も研究者が事前に設計したものであるため、自発的な密謀を検出する汎用能力とはまだ見なせない。

マルチエージェントシステムが、常にテキストを介して情報を交換するとは限らない。あるエージェントがresidual stream、または最後のtokenの隠れ状態を別のエージェントの入力embeddingへ直接挿入した場合、公開transcriptに残るのは最終的な行動だけで、戦略的意図を伝える連続ベクトルは既存の監査を回避する可能性がある。
研究チームはVerifiable Latent Alignments(VLA)を提案し、隠れ状態の受け渡しと、その後の公開行動に共通のcorrelation IDを付与した。監視機構はまず、中立的な通信から次元ごとのGaussian分布を構築し、正常な多様体から逸脱するベクトルを検出する。第2層では、受信した疑わしいベクトルを使用した場合と、そのベクトルを遮断または中立ベクトルに置換した場合の行動確率分布を比較し、有害な方向への期待値のシフトとKL divergenceによって因果的影響を測定する。第3層ではTopK sparse autoencoderを使用し、再構成誤差、未知の特徴、希少な特徴を特定する。3層すべての閾値は中立データのみで較正され、攻撃ラベルは評価だけに使用された。
Nanda Townのオークションsandboxでは、同一モデルのエージェントに対する系列監視の平均AUROCは0.993だったが、Qwen、Mistral、Vicuna、Phiのモデル空間をまたぐと0.854に低下した。Qwen3-0.6Bを用いた25~100の入札者による試験でも、少なくとも0.917を維持した。white-box介入では、対応する中立状態を使って意思決定を再実行することで、低価格での共謀行動が47.3パーセントポイント減少した。
これらの数値には、重要な制約が2つある。AUROCの陽性クラスには、平文による共謀と隠れ状態による共謀の両方が含まれており、潜在チャネルだけを検出した結果ではない。また、受信側エージェントには非公開状態を解釈するよう明示的に指示され、攻撃コードもオフライン最適化によって得られたものだった。第2層はさらに、デプロイ時に対応する反実仮想コントロールを利用できることを前提としている。white-boxによる修正にはモデルのactivationへのアクセスと、追加のforward passも必要になる。今後エンジニアリングチームは、エージェントが自律的に発達させ、正常な分布を意図的に模倣するプロトコルにもこの手法が対応できるか、さらに研究コードと完全なテストデータが公開されるかを注視すべきだ。