ホームへ戻る

AI 安全與標準

Anthropic、Claudeのテキスト透かしを説明:検出は確率を示すだけで、著者の身元は証明できない

Anthropicは、対応する新しいClaudeモデルがテキスト生成時に不可視のシグナルを埋め込み、生成ファイルには署名ベースの来歴データを付加できると説明した。一方で、短文、書き換え、翻訳は検出精度を低下させ、シグナルが見つからなくてもClaudeによる生成を否定できないと警告している。

البرمجية: كلود لقطة الشاشة: أنون · Public domain · Image source
zh-Hant

Anthropicの最新説明では、Claudeのコンテンツ標識を2つの技術的アプローチに分けている。プレーンテキストにはモデルレベルの透かしを採用し、モデルがtokenを選択する際、対応する鍵を持つ者だけが統計的に検出できるパターンを加える。読者にはラベルが表示されず、コピー&ペーストや軽微な編集後も残る可能性がある。一方、Claudeが生成したSVG、PNG、JPGなどのファイルには署名ベースの来歴メタデータを付加でき、検証ツールによってファイルが変更されたかどうかを確認できる。両者を混同してはならない。前者は統計的シグナルであり、後者のほうが検証可能なファイル来歴チェーンに近い。

FAQでは、この技術から導ける結論を特に限定している。検出器が返すのは、テキストにClaudeの透かしが含まれている可能性であり、著者の身元、執筆プロセス、内容の真偽を証明するものではない。サンプルが短すぎると十分な統計量を確保できず、大幅な削除・編集、再生成、翻訳、書き換えによってシグナルが損なわれる可能性もある。逆に、モデルの出力にユーザーが提供した原文が含まれている場合、検出結果からすべての文がモデルによって作成されたとは判断できない。したがって、学校、プラットフォーム、企業は、1回の透かし判定を処分やブロックの直接的な根拠にすべきではない。

この導入は、EU AI Act第50条の透明性義務に関係している。欧州委員会によると、プロバイダーは技術的に可能な範囲で、合成コンテンツを機械可読かつ検出可能で信頼性の高い形式により標識しなければならない。関連する義務は2026年8月2日から適用される。APIチームにとって、より堅実な監査方法は、引き続きmodel ID、タイムスタンプ、元の出力、ハッシュを保存し、透かしを補助的なシグナルとしてのみ利用することだ。今後注目すべき点は、検出インターフェースがいつ公開されるか、言語やテキスト長ごとの誤判定率、そしてソーシャルプラットフォームでの再エンコードやモデルによる書き換え後の信頼性である。

出典

  1. Claude Text Watermark
  2. How Claude Marks AI-Generated Content
  3. Code of Practice on Transparency of AI-Generated Content