返回首頁

AI 安全與內容來源

Anthropic 為新 Claude 輸出加入模型級文字浮水印,檔案採 C2PA 簽章

Anthropic 表示,8 月 2 日起推出的 Claude 模型會在文字內嵌入不可見標記,並為支援的圖片與文件加入簽章式來源資料。技術規格與第三方偵測工具尚未公開,現階段不能把標記視為完整的生成證明。

البرمجية: كلود لقطة الشاشة: أنون · Public domain · Image source
zh-Hant

Anthropic 新公開的內容標記方案,不只是在 Claude 網頁介面附加「AI 生成」標籤,而是把訊號放進模型輸出本身。公司表示,2026 年 8 月 2 日起推出並支援此功能的 Claude 模型,會在所有產品、API 與合作平台產生的文字中織入不可見浮水印;因為標記屬於文字的一部分,複製貼上後仍可能保留,也可能承受部分編輯。適用範圍是全球,而非只限歐盟使用者。

圖片等檔案採用不同機制。Anthropic 計畫為 PNG、JPEG、SVG 等支援格式加入數位簽署的來源中繼資料,並採用 C2PA Content Credentials。C2PA 記錄檔案的來源與處理歷程,可由簽章驗證是否遭修改;它和文字浮水印這類內容內訊號並不等價,另存、轉碼或移除中繼資料時的存活特性也不同。

這項變更回應歐盟《AI Act》第 50 條自 8 月 2 日生效的透明度義務,該條要求生成式系統在技術可行範圍內,提供機器可讀、可偵測且具互通性的標記。不過 Anthropic 尚未說明文字編碼方法、誤判率、重寫耐受度或不同語言與程式碼輸出的影響,第三方偵測介面也仍待後續技術文件。官方更明確警告:找到標記只表示內容可能曾由 Claude 處理,找不到也不能證明內容出自人類。工程團隊因此不應立即把它接成封鎖或紀律處分規則;下一步應觀察偵測 API、金鑰與撤銷機制、舊模型過渡安排,以及格式化、翻譯和多模型改寫後的實測可靠度。

來源

  1. How Claude marks AI-generated content
  2. Code of Practice on Transparency of AI-generated Content
  3. C2PA Specifications 2.2