☁Zero Trust 上手指南
繁體中文
Telegram Cloudflare 文件 ↗

模組 7d — 智慧體網際網路:AI 爬蟲與機器人管控

目標: 管控 AI 爬蟲與機器人如何訪問你自己的公開內容——看清誰在爬取、按用途允許/阻止它們、執行 robots.txt,並(可選)用 Pay Per Crawl 將訪問變現。

👤 誰來做 Web / 內容 / 安全團隊(站點所有者)
⏱️ 用時 約 30 分鐘
🎯 完成後你將擁有 對你站點上 AI 爬蟲的可見性,以及逐爬蟲的有意識 允許/阻止/收費 策略
✋ 開始前 一個在 Cloudflare 上的域名(zone)。這屬於 應用安全(Application Security)(保護流入你公開站點的入站流量)——與 Zero Trust 模組不同,但屬於同一個 AI 安全故事。

🧭 相反的方向。 本指南的其他每個模組保護的都是向外的流量——你的人與智慧體訪問網際網路、應用與 AI 模型。本模組是相反方向: AI 爬蟲與智慧體進入你的公開網站。隨著網際網路變得"智慧體化",這一入站流量如今已是流量的大多數——所以管控它自成一門功課。

為什麼現在重要(Cloudflare 2026 智慧體網際網路報告)

  • AI 的採用速度約為智慧手機的 2 倍——3.5 年內 25 億使用者(占人類 30%)。
  • 如今超過 50% 的網際網路流量是非人類的——機器人與 AI 智慧體越過了這一歷史性門檻。
  • 52% 的爬蟲請求用於 AI 訓練(2026 年 6 月),高於 2025 年春季的 22%。
  • 人們線上搜尋的每一小時裡,只有約 15 分鐘花在開放網路上——AI 的回答日益取代點選("Google Zero")。
  • 舊的交換——用內容換取推薦流量——正在瓦解,因此一個內容許可經濟正在興起(自 2023 年以來已有 50+ 家出版商–AI 達成協議)。

對你的意義: 任何線上釋出內容的組織,現在都需要有意識地決定哪些 AI 系統可以訪問它、用於什麼目的、以及在什麼條件下。Cloudflare 的 AI Crawl Control 就是你做這件事的地方。


A 部分 — 看清誰在爬取你(AI Audit)

Cloudflare 上的每個站點都能在 AI Crawl Control 內使用 AI Audit。

  1. 👉 在 Cloudflare 控制台,選擇你的賬戶和域名,然後前往 AI Crawl Control。
  2. 👉 開啟 Crawlers 選項卡。
  3. 📺 你會看到: 一張訪問你站點的 AI 爬蟲表,含:
    • Crawler 及擁有它的運營方(GPTBot/OpenAI、ClaudeBot/Anthropic、Bytespider/ByteDance…)
    • Category(類別)(AI Crawler、AI Assistant、AI Search、Archiver…)
    • Requests(允許 + 未成功,帶趨勢)
    • Robots.txt 違規次數
  4. 👉 開啟 Metrics 選項卡按時間繪製活動——按 Crawler / Category / Operator / Host / 狀態碼分組,並(在付費套餐上)檢視顯示哪些 AI 運營方給你帶來流量的引薦(referrer)分析。

✅ 檢查點: 你能看到哪些 AI 爬蟲訪問你的內容及其強度。

💡 檢測質量: 在免費套餐上,爬蟲按 user-agent 識別(可捕獲知名的、自我標識的機器人)。付費套餐增加 Cloudflare 的 Bot Management 檢測,用於不自我標識的爬蟲。


B 部分 — 管控每個爬蟲(允許 / 阻止 / 收費)

逐爬蟲決定它可以如何訪問你的內容。

  1. 👉 在 Crawlers 選項卡找到某爬蟲,使用 Action 列:
    • Allow(允許)——讓它爬取(適合會帶來引用/引薦的爬蟲,或你已有協議的情形)。
    • Block(阻止)——完全阻止。你可以配置返回的阻止響應。
    • Charge(收費)——按請求要求付費(Pay Per Crawl——D 部分)。
  2. 👉 可選地切換 Enforce robots.txt,讓 Cloudflare 自動為該爬蟲維護你的 robots.txt 規則。

按用途設定策略(推薦)

與其一次一個爬蟲,不如設定基於行為的策略:

  1. 👉 前往 Security → Settings → Configure AI bot policies。
  2. 👉 為每個行為預設選擇一種緩解方式:
    行為 是什麼 常見選擇
    Search 索引你的內容以便日後回答問題 Allow(保持可被發現)
    Agent 代表某人即時行動(chat-fetch、browser-use) 允許,或在廣告頁阻止
    Training 獲取內容以訓練/微調模型(含混合 Search+Training) 若你不想餵給模型訓練則 Block
  3. 👉 每個預設提供 Block(所有頁面)、Block on pages with ads(廣告頁阻止) 或 Allow(不阻止)。

⚠️ 2026 年 9 月 15 日起的新預設值: 對新域名,被分類為 Training 或 Agent 的爬蟲將在顯示廣告的頁面上被阻止,而 Search 保持允許;混合用途(Search+Training)爬蟲會被任何"阻止訓練"設定阻止。舊的一鍵 "Block AI bots" 開關正被這些行為策略取代。請檢查你的設定以匹配你的意圖。

✅ 檢查點: 每種爬蟲用途都有有意識的動作;被阻止的爬蟲會收到你配置的響應。

💡 需要更精細的控制? 使用 Cloudflare WAF 自定義規則(按路徑、按爬蟲)或 Redirect Rules 把爬蟲引導到特定區域——如允許爬取 /blog 但阻止 /pricing。


C 部分 — 執行 robots.txt

robots.txt 是你宣告的策略;AI Crawl Control 讓它可見且可執行。

  1. 👉 在 AI Crawl Control → Robots.txt 中,檢視檔案健康狀況、爬蟲違規與 Agent Readiness。
  2. 👉 開啟 managed robots.txt / 執行,讓 Cloudflare 用自動 WAF 規則維護你的指令(而非依賴爬蟲自願遵守)。
  3. 💡 考慮 Content Signals Policy(contentsignals.org)在 robots.txt 中直接宣告內容被訪問後如何使用(如允許搜尋、不許 AI 訓練)。

✅ 檢查點: 違規可見,且不合規的爬蟲可從 Crawlers 選項卡或經 WAF 被阻止。


D 部分 — 將訪問變現(Pay Per Crawl)

若你的內容具有訓練價值,你可以向 AI 爬蟲收費,而不僅是允許或阻止——把稀缺性轉化為收入。

🔒 Pay Per Crawl 處於私有/封閉測試階段。 在 cloudflare.com/paypercrawl-signup 報名,或聯絡你的 Cloudflare 客戶經理。

工作原理(站點所有者側):

  1. 👉 設定你的價格並選擇向哪些爬蟲收費。
  2. 👉 連線 Stripe 收款,並檢視交付分析。
  3. 📺 當爬蟲在未同意付費的情況下請求付費內容時,Cloudflare 返回 HTTP 402 Payment Required。選擇加入的爬蟲通過簽名的 HTTP 頭(crawler-max-price / crawler-exact-price,經 Web Bot Auth)傳送付費意圖,並按每次成功爬取計費。
  4. 👉 保持發現頁免費:某些路徑始終免費(/robots.txt、/sitemap.xml、/security.txt、/.well-known/security.txt、/crawlers.json),你還可通過 Rules → Configuration Rules → Disable Pay Per Crawl 對某個 URI 模式豁免更多。

✅ 檢查點: 選定的爬蟲被收費(或收到 402),而你的免費/發現路徑保持開放。


E 部分 — 監測趨勢

  • 👉 Cloudflare Radar(radar.cloudflare.com)釋出全網際網路的機器人與 AI 爬蟲洞察——有助於瞭解爬蟲行為在全行業如何變化。
  • 👉 定期回看 AI Crawl Control → Metrics;爬蟲構成變化很快(訓練與搜尋的比例在一年內就發生了劇烈變化)。

它如何融入 AI 安全全景

方向 你在保護什麼 模組
出站——你的人與智慧體使用 AI 資料、身份、成本、工具訪問 5d · 6 · 7 · 7b · 7c
入站——AI 訪問你的內容與應用 內容、智慧財產權、變現、應用濫用 7d(本篇) + AI Security for Apps(WAF)

兩者共同覆蓋完整的"智慧體網際網路":你既治理你的組織如何消費 AI,也治理 AI 生態如何消費你。


✅ 模組 7d 完成!

你現在擁有:

  • ✅ 對哪些 AI 爬蟲訪問你站點的可見性(AI Audit)
  • ✅ 逐爬蟲、按用途(Search / Agent / Training)的有意識 允許 / 阻止 / 收費 動作
  • ✅ 讓 robots.txt 可見且可執行
  • ✅ (測試版)用 Pay Per Crawl 將 AI 訪問變現
  • ✅ 瞭解 2026 年 9 月的預設值變化及在哪裡調整

快速排障

問題 解決辦法
我的站點沒有 AI Crawl Control 它是按 zone(域名) 的——先選擇賬戶和域名;域名須在 Cloudflare 上
爬蟲未被識別 免費套餐僅用 user-agent;升級以獲得對不自我標識機器人的 Bot Management 檢測
阻止了某爬蟲但它仍在索引 確認 Action = Block 已儲存,且沒有更高優先順序的 WAF/規則放行它;有些機器人無視 robots.txt(通過 Cloudflare 執行它,C 部分)
想允許搜尋但阻止訓練 使用 Configure AI bot policies 行為預設——允許 Search、阻止 Training(B 部分)
缺少 Pay Per Crawl 選項 它是封閉測試——報名或聯絡你的客戶團隊(D 部分)
誤阻止了一個好機器人 檢查 Configure AI bot policies(9 月 2026 預設值可能在廣告頁阻止 Training/Agent)並調整

👉 下一步:模組 8 — Cloudflare WAN

把整個辦公室和資料中心接入 Cloudflare 網路。