AI 評測與安全
Google、H100セキュアエンクレーブで二重盲検モデル評価を実証—モデル重みと非公開問題セットを相互に開示せず
Google DeepMind、MLCommonsなどの機関は、Gemini 2.5 Flash Liteと非公開の安全性評価問題セットを、検証可能な同一のセキュアエンクレーブ内に投入し、双方が取得できる結果を制限した。この設計はベンチマーク汚染のリスクを低減する一方、信頼は依然としてハードウェアのルートキー、Trusted Computing Base(TCB)、機関横断のコードレビューに依存する。

Google DeepMindは、MLCommons、OpenMined、AVERI、シンガポールAI Safety Instituteと共同で、二重盲検モデル評価の概念実証を完了した。モデル提供者はテスト用プロンプトを取得せず、評価者もモデル重みや推論コードを閲覧できない。実験ではGemini 2.5 Flash Liteに対し、隔離保管され、モデルに一度も処理させていないAILuminateの安全性評価用プロンプトを使用したほか、シンガポールの状況に即した有害コンテンツ誘発問題もテストした。
両者はまずインターフェースと実行ポリシーを審査し、その後、暗号化された資産をmTLS経由でGoogle Cloud A3 Confidential VMへストリーミングした。ホストはIntel TDXによるメモリ暗号化を使用し、NVIDIA H100 Confidential GPUがGPUメモリを保護する。OpenMined PySyftはジョブの提出、承認、実行を担った。Remote Attestationでは、ファームウェア、カーネル、コンテナ、アプリケーションイメージの測定値に署名する。双方が実行環境の一致を確認した場合に限り、モデル重みと問題セットが復号される。評価完了後に出力されるのは制限付きの集約指標のみで、一時キーと実行環境はエンクレーブとともに破棄される。
技術的な意義は、Geminiのスコアをもう一つ増やすことではない。非公開モデルに対し、サイバーセキュリティ、CBRNE、自傷、暴力などの高機密な未公開テストを実施しながら、問題セットが提供者のログや後続の学習データに混入することを防げる点にある。また、銀行、政府、研究機関がデータ主権を手放すことなく、外部モデルをテストできるようになる可能性もある。
ただし、セキュアエンクレーブは完全に「トラストレス」ではない。CPUおよびGPUメーカーのルートキーと、基盤にあるクローズドなファームウェアは、依然として信頼の基礎となる。Trusted Computing Baseのいずれかの層に脆弱性があれば、機密性と完全性の両方が損なわれる可能性がある。技術報告によると、現時点での主なボトルネックは、報告された5%未満の計算オーバーヘッドから、法的合意、各当事者によるコード承認、手作業での調整へと移っている。エンジニアリングチームが次に注視すべきなのは、再現可能なビルド、出力を通じた情報漏洩の制限、Attestationの失効メカニズム、そしてこのプロセスをブラックボックス出力だけでなく、activation probingやtoken単位のlog-likelihoodを必要とする評価へ拡張できるかどうかである。