AI 安全與營運控制
最先端AIラボ5社の制御策、最高評価でもC+ モデル封じ込め計画が最大の公開情報上の欠落に
Guidelightは、実行可能な6項目の制御策に基づきAnthropic、Google、Meta、OpenAI、xAIを評価したが、いずれの企業も、どの項目でも完全実施に近い水準には達しなかった。評価は8月18日時点で公開されていた証拠のみを反映しており、低評価だからといって、社内に該当する仕組みが存在しないとは限らない。

Guidelight AI Standardsは今回初めて、「制御不能なモデル」のリスクを、モデル公開前の能力テストに合格したかどうかだけでなく、監査可能な運用対策へと分解した。評価項目は、内部の推論ログ、モニターの有効性、危険なアクションのゲーティング、異常な急増時のcircuit breaker、第三者レビュー、事前に策定された封じ込め計画の6つ。データは、5社が公開したsystem card、リスクフレームワーク、報告書、外部組織との協力実績から収集した。
評価結果は、AnthropicとOpenAIがともにC+で、絶対スコアは2.50。GoogleはD+(1.50)、xAIはD−(0.83)、MetaはF(0.67)だった。0~5点の評価尺度で、3点、すなわち「実質的だが不完全な実施」を上回った項目は一つもなかった。Anthropicはアクションゲーティングとcircuit breakingで3点、OpenAIも封じ込め計画で3点を獲得した。一方、AnthropicとMetaは封じ込め計画で0点だった。xAIも、ログ記録とモニター検証では実施を示す得点を得られなかった。
長期的に動作するエージェントをデプロイするエンジニアリングチームにとって、この評価が示す重要な点は、制御プレーンをモデル自体から独立させる必要があることだ。ツール呼び出しと実行分岐を完全に保存し、モニターの見逃し率を測定し、高リスクな操作の前に承認を必須とするほか、大量のアラートが発生した際には、ネットワーク、認証情報、ワークロードの権限を自動的に取り消せるようにしなければならない。プロンプトによる拒否や公開前のレッドチームテストだけでは、稼働中のエージェントが監督の回避を短時間に繰り返し試みる状況には対処できない。
ただし、これは5社の社内システムに対するペネトレーションテストではない。この評価手法では、「公開された証拠がない」場合を、未実施または前提条件のみが整っている状態として扱う。また、実際の攻撃下における制御機構のrecall、latency、tamper resistanceも直接測定していない。今後は、各ラボがポリシー文書を増やすだけでなく、トリガーのしきい値、権限取り消し手順、再現可能な第三者ストレステストを公開するかどうかを注視すべきだ。