AI 基礎設施與網路標準
Cloudflare 拆分搜尋、訓練與代理爬蟲控制,但 Bing 的拒絕訓練訊號尚未自動生效
Cloudflare 新增「Disallow AI Training」,以 robots.txt 偏好搭配網路層分類,讓網站保留搜尋收錄並拒絕模型訓練。既有設定會自動遷移,但 Applebot、Googlebot、Bingbot 的支援程度不同,錯選 Block 仍可能直接犧牲搜尋能見度。

Cloudflare 9 月 15 日重整 AI Crawl Control,把爬蟲行為明確拆成 Search、Training 與 Agent,並加入「Disallow AI Training」。啟用後,Bot Preference Sync 會在 `robots.txt` 發布各業者適用的拒絕訓練規則;對沒有可信分流機制的訓練爬蟲,Cloudflare則可在網路層封鎖,而不是只期待對方自律。Apple、Google及Microsoft被列為「Accountable」混合用途爬蟲營運者,資格要求包括訓練退出、AI摘要退出、URL層級透明度,以及退出訓練不影響傳統搜尋。
技術重點在於偏好訊號和存取控制並非同一件事。Google的`Google-Extended`只是控制權杖,實際抓取仍使用既有Google使用者代理;Google文件確認,拒絕它不影響搜尋收錄或排名,但會限制內容用於未來Gemini訓練及部分grounding。Apple另有`Applebot-Extended`。Bing目前主要依賴`NOARCHIVE`及站長工具,Cloudflare表示要到2027年初才預期支援網站層級robots拒絕訓練,因此現在單開新設定並不能自動向Bing傳達相同偏好。
這次亦有遷移風險:舊的「Block AI Bots」將退場,原先Training的Block會轉為Disallow AI Training;新的Block則會連混合用途搜尋爬蟲一起擋掉。維運團隊應重新檢查生成後的`robots.txt`、WAF事件、搜尋索引與爬蟲身分判定。它仍不是法律或密碼學保證:偽裝身分、未遵守robots規則的爬蟲,以及使用者指示的瀏覽代理都尚無統一政策;IETF的AI偏好標準也仍在形成中。