返回首頁

AI 安全與標準

Anthropic 說明 Claude 文字浮水印:偵測只提供機率,不能證明作者身分

Anthropic 說明支援的新 Claude 模型會在文字生成過程嵌入不可見訊號,產生的檔案則可加入簽章式來源資料。官方同時警告,短文、改寫與翻譯會削弱偵測,找不到訊號也不能排除內容曾由 Claude 生成。

البرمجية: كلود لقطة الشاشة: أنون · Public domain · Image source
zh-Hant

Anthropic 最新說明把 Claude 的內容標記分成兩條技術路徑。純文字採模型層級浮水印:模型在選擇 token 時加入只有持有對應金鑰者才能統計檢測的模式,讀者不會看到標籤,複製貼上或輕微編輯後仍可能保留。Claude 產生的 SVG、PNG、JPG 等檔案則可攜帶簽章式來源中繼資料,讓驗證工具檢查檔案是否經過修改。兩者不能混為一談;前者是統計訊號,後者才接近可驗證的檔案來源鏈。

FAQ 特別收窄了這項技術可支持的結論。偵測器回傳的是文字含有 Claude 浮水印的可能性,不是作者身分、寫作過程或內容真偽的證明。樣本太短會缺乏足夠統計量,大幅刪改、重新生成、翻譯或改寫也可能破壞訊號;反過來,模型輸出若包含使用者提供的原文,偵測結果亦不能說明每一句都由模型創作。因此,學校、平台和企業不應把單次浮水印判定直接當成處分或封鎖依據。

這項部署與歐盟《AI 法案》第 50 條的透明度義務相關。歐盟委員會指出,供應者須在技術可行範圍內,以機器可讀、可偵測且可靠的格式標記合成內容;相關義務自 2026 年 8 月 2 日適用。對 API 團隊而言,較穩妥的稽核方式仍是保存模型 ID、時間戳、原始輸出及雜湊,浮水印只作輔助訊號。接下來值得追蹤的是檢測介面何時開放、不同語言及長度的誤判率,以及經社群平台重新編碼或模型改寫後的可靠度。

來源

  1. Claude Text Watermark
  2. How Claude Marks AI-Generated Content
  3. Code of Practice on Transparency of AI-Generated Content