模块 7d — 智能体互联网:AI 爬虫与机器人管控
目标: 管控 AI 爬虫与机器人如何访问你自己的公开内容——看清谁在爬取、按用途允许/阻止它们、执行 robots.txt,并(可选)用 Pay Per Crawl 将访问变现。
| 👤 谁来做 | Web / 内容 / 安全团队(站点所有者) |
| ⏱️ 用时 | 约 30 分钟 |
| 🎯 完成后你将拥有 | 对你站点上 AI 爬虫的可见性,以及逐爬虫的有意识 允许/阻止/收费 策略 |
| ✋ 开始前 | 一个在 Cloudflare 上的域名(zone)。这属于 应用安全(Application Security)(保护流入你公开站点的入站流量)——与 Zero Trust 模块不同,但属于同一个 AI 安全故事。 |
🧭 相反的方向。 本指南的其他每个模块保护的都是向外的流量——你的人与智能体访问互联网、应用与 AI 模型。本模块是相反方向: AI 爬虫与智能体进入你的公开网站。随着互联网变得"智能体化",这一入站流量如今已是流量的大多数——所以管控它自成一门功课。
为什么现在重要(Cloudflare 2026 智能体互联网报告)
- AI 的采用速度约为智能手机的 2 倍——3.5 年内 25 亿用户(占人类 30%)。
- 如今超过 50% 的互联网流量是非人类的——机器人与 AI 智能体越过了这一历史性门槛。
- 52% 的爬虫请求用于 AI 训练(2026 年 6 月),高于 2025 年春季的 22%。
- 人们在线搜索的每一小时里,只有约 15 分钟花在开放网络上——AI 的回答日益取代点击("Google Zero")。
- 旧的交换——用内容换取推荐流量——正在瓦解,因此一个内容许可经济正在兴起(自 2023 年以来已有 50+ 家出版商–AI 达成协议)。
对你的意义: 任何在线发布内容的组织,现在都需要有意识地决定哪些 AI 系统可以访问它、用于什么目的、以及在什么条件下。Cloudflare 的 AI Crawl Control 就是你做这件事的地方。
A 部分 — 看清谁在爬取你(AI Audit)
Cloudflare 上的每个站点都能在 AI Crawl Control 内使用 AI Audit。
- 👉 在 Cloudflare 控制台,选择你的账户和域名,然后前往 AI Crawl Control。
- 👉 打开 Crawlers 选项卡。
- 📺 你会看到: 一张访问你站点的 AI 爬虫表,含:
- Crawler 及拥有它的运营方(GPTBot/OpenAI、ClaudeBot/Anthropic、Bytespider/ByteDance…)
- Category(类别)(AI Crawler、AI Assistant、AI Search、Archiver…)
- Requests(允许 + 未成功,带趋势)
- Robots.txt 违规次数
- 👉 打开 Metrics 选项卡按时间绘制活动——按 Crawler / Category / Operator / Host / 状态码分组,并(在付费套餐上)查看显示哪些 AI 运营方给你带来流量的引荐(referrer)分析。
✅ 检查点: 你能看到哪些 AI 爬虫访问你的内容及其强度。
💡 检测质量: 在免费套餐上,爬虫按 user-agent 识别(可捕获知名的、自我标识的机器人)。付费套餐增加 Cloudflare 的 Bot Management 检测,用于不自我标识的爬虫。
B 部分 — 管控每个爬虫(允许 / 阻止 / 收费)
逐爬虫决定它可以如何访问你的内容。
- 👉 在 Crawlers 选项卡找到某爬虫,使用 Action 列:
- Allow(允许)——让它爬取(适合会带来引用/引荐的爬虫,或你已有协议的情形)。
- Block(阻止)——完全阻止。你可以配置返回的阻止响应。
- Charge(收费)——按请求要求付费(Pay Per Crawl——D 部分)。
- 👉 可选地切换 Enforce robots.txt,让 Cloudflare 自动为该爬虫维护你的
robots.txt规则。
按用途设定策略(推荐)
与其一次一个爬虫,不如设定基于行为的策略:
- 👉 前往 Security → Settings → Configure AI bot policies。
- 👉 为每个行为预设选择一种缓解方式:
行为 是什么 常见选择 Search 索引你的内容以便日后回答问题 Allow(保持可被发现) Agent 代表某人实时行动(chat-fetch、browser-use) 允许,或在广告页阻止 Training 获取内容以训练/微调模型(含混合 Search+Training) 若你不想喂给模型训练则 Block - 👉 每个预设提供 Block(所有页面)、Block on pages with ads(广告页阻止) 或 Allow(不阻止)。
⚠️ 2026 年 9 月 15 日起的新默认值: 对新域名,被分类为 Training 或 Agent 的爬虫将在显示广告的页面上被阻止,而 Search 保持允许;混合用途(Search+Training)爬虫会被任何"阻止训练"设置阻止。旧的一键 "Block AI bots" 开关正被这些行为策略取代。请检查你的设置以匹配你的意图。
✅ 检查点: 每种爬虫用途都有有意识的动作;被阻止的爬虫会收到你配置的响应。
💡 需要更精细的控制? 使用 Cloudflare WAF 自定义规则(按路径、按爬虫)或 Redirect Rules 把爬虫引导到特定区域——如允许爬取 /blog 但阻止 /pricing。
C 部分 — 执行 robots.txt
robots.txt 是你声明的策略;AI Crawl Control 让它可见且可执行。
- 👉 在 AI Crawl Control → Robots.txt 中,查看文件健康状况、爬虫违规与 Agent Readiness。
- 👉 开启 managed robots.txt / 执行,让 Cloudflare 用自动 WAF 规则维护你的指令(而非依赖爬虫自愿遵守)。
- 💡 考虑 Content Signals Policy(contentsignals.org)在
robots.txt中直接声明内容被访问后如何使用(如允许搜索、不许 AI 训练)。
✅ 检查点: 违规可见,且不合规的爬虫可从 Crawlers 选项卡或经 WAF 被阻止。
D 部分 — 将访问变现(Pay Per Crawl)
若你的内容具有训练价值,你可以向 AI 爬虫收费,而不仅是允许或阻止——把稀缺性转化为收入。
🔒 Pay Per Crawl 处于私有/封闭测试阶段。 在 cloudflare.com/paypercrawl-signup 报名,或联系你的 Cloudflare 客户经理。
工作原理(站点所有者侧):
- 👉 设定你的价格并选择向哪些爬虫收费。
- 👉 连接 Stripe 收款,并查看交付分析。
- 📺 当爬虫在未同意付费的情况下请求付费内容时,Cloudflare 返回
HTTP 402 Payment Required。选择加入的爬虫通过签名的 HTTP 头(crawler-max-price/crawler-exact-price,经 Web Bot Auth)发送付费意图,并按每次成功爬取计费。 - 👉 保持发现页免费:某些路径始终免费(
/robots.txt、/sitemap.xml、/security.txt、/.well-known/security.txt、/crawlers.json),你还可通过 Rules → Configuration Rules → Disable Pay Per Crawl 对某个 URI 模式豁免更多。
✅ 检查点: 选定的爬虫被收费(或收到 402),而你的免费/发现路径保持开放。
E 部分 — 监测趋势
- 👉 Cloudflare Radar(radar.cloudflare.com)发布全互联网的机器人与 AI 爬虫洞察——有助于了解爬虫行为在全行业如何变化。
- 👉 定期回看 AI Crawl Control → Metrics;爬虫构成变化很快(训练与搜索的比例在一年内就发生了剧烈变化)。
它如何融入 AI 安全全景
| 方向 | 你在保护什么 | 模块 |
|---|---|---|
| 出站——你的人与智能体使用 AI | 数据、身份、成本、工具访问 | 5d · 6 · 7 · 7b · 7c |
| 入站——AI 访问你的内容与应用 | 内容、知识产权、变现、应用滥用 | 7d(本篇) + AI Security for Apps(WAF) |
两者共同覆盖完整的"智能体互联网":你既治理你的组织如何消费 AI,也治理 AI 生态如何消费你。
✅ 模块 7d 完成!
你现在拥有:
- ✅ 对哪些 AI 爬虫访问你站点的可见性(AI Audit)
- ✅ 逐爬虫、按用途(Search / Agent / Training)的有意识 允许 / 阻止 / 收费 动作
- ✅ 让
robots.txt可见且可执行 - ✅ (测试版)用 Pay Per Crawl 将 AI 访问变现
- ✅ 了解 2026 年 9 月的默认值变化及在哪里调整
快速排障
| 问题 | 解决办法 |
|---|---|
| 我的站点没有 AI Crawl Control | 它是按 zone(域名) 的——先选择账户和域名;域名须在 Cloudflare 上 |
| 爬虫未被识别 | 免费套餐仅用 user-agent;升级以获得对不自我标识机器人的 Bot Management 检测 |
| 阻止了某爬虫但它仍在索引 | 确认 Action = Block 已保存,且没有更高优先级的 WAF/规则放行它;有些机器人无视 robots.txt(通过 Cloudflare 执行它,C 部分) |
| 想允许搜索但阻止训练 | 使用 Configure AI bot policies 行为预设——允许 Search、阻止 Training(B 部分) |
| 缺少 Pay Per Crawl 选项 | 它是封闭测试——报名或联系你的客户团队(D 部分) |
| 误阻止了一个好机器人 | 检查 Configure AI bot policies(9 月 2026 默认值可能在广告页阻止 Training/Agent)并调整 |
👉 下一步:模块 8 — Cloudflare WAN
把整个办公室和数据中心接入 Cloudflare 网络。