ホームへ戻る

AI 安全與內容來源

Anthropic、新Claudeの出力にモデルレベルのテキスト透かしを導入、ファイルにはC2PA署名を採用

Anthropicによると、8月2日以降に提供されるClaudeモデルは、テキストに不可視のマーカーを埋め込み、対応する画像や文書には署名付きの来歴データを付与する。技術仕様と第三者向け検出ツールはまだ公開されておらず、現時点でこのマーカーを生成元の完全な証明とみなすことはできない。

البرمجية: كلود لقطة الشاشة: أنون · Public domain · Image source
zh-Hant

Anthropicが新たに公開したコンテンツ・マーキング方式は、ClaudeのWebインターフェースに「AI生成」ラベルを付けるだけでなく、モデルの出力自体にシグナルを組み込むものだ。同社によると、2026年8月2日以降にリリースされ、この機能に対応するClaudeモデルは、すべての製品、API、提携プラットフォームで生成するテキストに不可視の透かしを織り込む。マーカーはテキストの一部であるため、コピー&ペースト後も残る可能性があり、ある程度の編集にも耐えられる可能性がある。適用範囲はEUのユーザーに限定されず、全世界が対象となる。

画像などのファイルには、別の仕組みが採用される。Anthropicは、PNG、JPEG、SVGなどの対応形式に、デジタル署名された来歴メタデータを追加し、C2PA Content Credentialsを採用する計画だ。C2PAはファイルの出所と処理履歴を記録し、署名によって改変の有無を検証できる。ただし、これはテキスト透かしのようなコンテンツ内シグナルと同等ではなく、別名保存、トランスコード、メタデータ削除を行った際の残存特性も異なる。

この変更は、8月2日に適用が開始されるEU AI Act第50条の透明性義務に対応するものだ。同条は生成AIシステムに対し、技術的に実現可能な範囲で、機械可読かつ検出可能で、相互運用性を備えたマーキングを提供するよう求めている。ただしAnthropicは、テキストのエンコード方式、誤検出率、書き換えへの耐性、言語やコード出力の違いによる影響をまだ説明しておらず、第三者向けの検出インターフェースについても今後の技術文書を待つ必要がある。同社はさらに、マーカーが見つかった場合も、そのコンテンツがClaudeによって処理された可能性を示すにすぎず、見つからなかったからといって人間が作成した証明にはならないと明確に警告している。このため、エンジニアリングチームは現段階で、検出結果をブロックや懲戒処分のルールに直結させるべきではない。今後は、検出API、鍵と失効の仕組み、旧モデルからの移行方針に加え、フォーマット変更、翻訳、複数モデルによる書き換え後の実測上の信頼性を見極める必要がある。

出典

  1. How Claude marks AI-generated content
  2. Code of Practice on Transparency of AI-generated Content
  3. C2PA Specifications 2.2