AI 安全與私隱
8つのクローズドモデルでは通常の応答にコンテキスト内の秘密が潜み得る、4桁の正確な復元率は82%
新たな研究によると、モデルが秘密の直接的な漏洩を拒否しても、応答の長さ、形式、語彙などの統計的特徴がコンテキスト情報を伝える可能性がある。適応型ブラックボックス攻撃では、2桁の秘密をほぼ完全に復元でき、4桁でも正確な一致率は82%に達した。

AIエージェントは通常、カレンダー、医療記録、認証情報、長期記憶などをモデルのコンテキストに格納する。既存の防御策の多くは、出力が機密情報を直接繰り返していないかだけを検査する。[最新のプレプリント](https://arxiv.org/abs/2608.19857)によると、テスト対象となった8つのクローズドモデルは、秘密を直接要求するプロンプトをすべて適切に拒否したものの、通常の応答には秘密の違いに応じて、token、長さ、句読点、形式、単語選択に測定可能な差異が生じた。
研究者らはこの問題を predicate inference(述語推論)として定式化した。攻撃者は対象APIをブラックボックスで照会し、秘密の候補ごとに出力分布へ及ぼす影響をあらかじめ推定したうえで、各桁の事後確率を逐次更新するだけでよい。Claude Opus 4.6では、適応型プロンプトにより4桁の復元率が静的手法の44%から82%へ上昇し、2桁ではほぼすべてを復元できた。ただし、モデル間の差は大きく、少なくとも2つのモデルは秘密が4桁になるとランダム推測に近い結果となった。別の実験では、小規模なQwenデコーダーを使って日常的なテキストを分析し、健康や財務に関する記憶などの隠れた属性について最大0.319の推論優位性を記録した。さらに、能動的攻撃によって、エージェントに感嘆符の数で米国の社会保障番号(SSN)全体を符号化させることもできた。
これは、「モデルが秘密を口にしていない」ことが情報漏洩ゼロを意味するわけではないことを示している。出力フィルターや拒否応答のテストでも、統計的な covert channel(隠れチャネル)は網羅できない。エンジニアリングチームは、機密性の高いコンテキストの存続時間を短縮し、ツールの認証情報を生成モデルから隔離するとともに、複数回のクエリにまたがる属性推論をレッドチームテストに組み込むべきだ。[カリフォルニア大学バークレー校の技術報告書](https://www2.eecs.berkeley.edu/Pubs/TechRpts/2026/EECS-2026-126.html)も、この現象をモデル能力の向上に伴って拡大し得る内在的リスクと位置づけている。ただし、今回の結果は依然として制御された実験によるもので、対象モデルが既知であることや、一度限りの推定コストを要することを前提としている。したがって、任意の本番データを同じ割合で復元できると直接結論づけることはできない。