robots.txt 只是表态,遵不遵守全看爬虫自己。真正能拦住的是 AI Crawl Control 与安全设置里的 AI bot 策略——免费方案就能用,落地是在边缘执行的一条 WAF 自定义规则。
这两年站长的抱怨从「百度不收录」变成了「AI 把我的文章原样喂进去了」。查日志会发现事情分成独立的两半:一半是内容被拿去训练,你在意版权和署名;另一半是抓取频率高到把小机器打满,你在意账单和可用性。
Cloudflare 的工具也分成这两类,并且分得比多数中文教程讲的细。下面把边界一次讲清,顺便说一件时间上很紧的事:2026 年 9 月 15 日,新接入域名的默认值就要变了。
robots.txt 是请求,不是门
绝大多数「怎么屏蔽 AI 爬虫」的中文答案,最后落到的都是往 robots.txt 里加上 User-agent: GPTBot 和 Disallow: /。这一步值得做,但要清楚它的性质。
Cloudflare 的文档写得没有余地:遵守 robots.txt 是自愿的,这个文件表达的是你的偏好,并不在技术层面阻止任何人访问你的内容,部分爬虫运营方会径直无视 Disallow 继续抓。换句话说,它是一份声明,不是一道门。
Cloudflare 提供了一个托管 robots.txt 的开关(安全设置里,免费方案可用)。打开后它替你生成并维护这个文件,内含一份针对常见 AI 训练爬虫的屏蔽指令,以及 内容信号(Content Signals) 政策文本。官方文档里给出的托管名单包含这些标识:
GPTBot、ClaudeBot、CCBot、meta-externalagentBytespider(字节跳动)、AmazonbotGoogle-Extended、Applebot-Extended
这份名单里没有 Baiduspider,也没有 Googlebot——这就是很多人担心的「屏蔽 AI 会不会连搜索收录一起断掉」的答案:托管名单针对的是各家为 AI 用途单列的抓取标识,不是搜索索引用的那一个。
还有个容易忽略的行为:源站本来就有 robots.txt(能返回 200)时,Cloudflare 不覆盖它,而是把托管内容拼在原有内容前面合成一份返回。细节见 托管 robots.txt 文档。
三层手段,只有两层真的会拦人
把这些手段按「能不能强制执行」排一排,结构就清楚了。
第三层的 AI 迷宫(AI Labyrinth) 值得单独说一句:它在页面里插入带 Nofollow 标记的隐藏链接,不守规矩的爬虫会掉进一串走不完的链接里,记录下来的特征还会被所有选择屏蔽 AI 机器人的 Cloudflare 客户共用。官方说明这些链接对搜索引擎优化和页面外观没有影响,只有机器人看得见。开关同样在安全设置里,按 免费方案的机器人能力表,免费也能开。
两个入口,管的不是同一件事
真正会拦人的那一层有两个入口,名字都带 AI,很容易混。区别是一个按爬虫点名,一个按行为分类。
| 对比项 | AI Crawl Control | AI bot 策略 |
|---|---|---|
| 在哪 | 仪表盘 AI Crawl Control | 安全设置 → 配置 AI bot 策略 |
| 粒度 | 逐个爬虫点名放行或拦截 | 按搜索、代理、训练三类批量处置 |
| 依据 | 实际来访过的爬虫清单,带请求量与违规次数 | Cloudflare 的行为分类,不看你的实际流量 |
| 动作 | 放行 / 拦截(按次计费为封闭测试) | 全站拦截 / 仅在含广告的页面拦截 / 放行 |
| 代价 | 拦截会占用一条 WAF 自定义规则 | 不占用自定义规则配额 |
按 官方对 AI 机器人的分类,三类行为是:搜索(收集或索引内容以便日后回答问题)、代理(实时替真人办事,如聊天抓取和浏览器代理)、训练(拿内容训练或微调模型)。一个爬虫可以同时具备多种行为——这是后面那个坑的根源。
AI Crawl Control 的用法很直白:进 Crawlers 标签页,表里是实际来过的爬虫、所属运营方、请求量趋势,以及各自违反 robots.txt 的次数,在 Action 列选放行或拦截即可。 Directives 标签页 还会列出是哪个爬虫、抓了哪个路径、撞上了你 robots.txt 里的哪一行——它把「谁不守规矩」从猜测变成了名单。
拦截落地成一条 WAF 规则,这有副作用
在 AI Crawl Control 里点了拦截之后,Cloudflare 会在你的域名下创建或更新一条 WAF 自定义规则来执行它;选择全部放行则不占用任何自定义规则。这带来两个必须知道的后果。
一是配额。WAF 自定义规则 在免费方案上限是 5 条,Pro 是 20 条。手上规则本来就紧的人,要把这一条算进预算里。
二是执行顺序。这条规则和你其它自定义规则处在同一阶段,排在前面的先生效。于是会出现:你明明把某个爬虫设成了放行,它还是被拦——上游另一条规则先挡掉了它,而这类拦截未必出现在 AI Crawl Control 的统计里。官方建议是,打算统一管理时就把已有规则里涉及 AI 爬虫的部分改掉,详见 AI Crawl Control 与 WAF 的配合说明。
9 月 15 日,新域名的默认值要变
按 官方文档,2026 年 9 月 15 日起,Cloudflare 会给新接入的域名启用一套新默认值:归类为训练或代理的机器人,会在展示广告的页面上被拦截;搜索类保持放行。同时,旧版的「屏蔽 AI 机器人」开关将在同一天弃用。
真正值得留意的是随之而来的另一句:兼做搜索与训练的混合用途爬虫,会被所有屏蔽 AI 训练的配置一起拦掉,包括那个旧开关。而旧开关原本是把混合用途排除在外的——同一个开关,含义在这一天变了。
9 月 15 日之前,所有用户都可以在安全设置里选择不采用这套新默认值。要不要退出,取决于你站点的内容策略:
- 内容以引流为主、希望尽可能被各种入口收录——考虑退出,或至少只拦纯训练类。
- 内容本身就是资产、被原样搬走等于损失——不必退出,新默认值的方向和你一致。
- 站上没有广告——「仅在含广告的页面拦截」这一档对你等于没开,要拦就得明确选全站拦截。
免费方案能做到哪一步
功能层面免费方案基本都给了,短板在识别精度和数据保留上,官方文档标得很清楚,照抄一遍免得误判。
| 能力 | 免费方案 | 升级之后 |
|---|---|---|
| 爬虫识别方式 | 只按 User-Agent 字符串,认得出自报家门的知名爬虫 | 可用 Bot Management 的检测 ID 做更彻底的识别 |
| 指标保留 | Metrics 标签页只显示最近 24 小时 | 更长的历史区间 |
| 拦截响应自定义 | 不支持 | 付费方案可配置拦截时返回的响应 |
| WAF 自定义规则 | 5 条(AI Crawl Control 的拦截占 1 条) | Pro 20 条,Business 100 条 |
| AI 迷宫 / 托管 robots.txt | 都可用 | 相同 |
「只按 User-Agent 识别」这句要吃透:爬虫若不自报家门,或者干脆伪装成普通浏览器,免费方案的这张表里根本不会出现它,你也就无从拦起。想知道某个爬虫 Cloudflare 认不认、归成哪一类,对照 已验证机器人文档里的分类口径。
国内站长要多想的三件事
字节跳动的爬虫在默认名单里
Bytespider 出现在 Cloudflare 托管 robots.txt 的屏蔽名单里,打开那个开关等于同时向字节表明了态度。这条在中文语境下常被漏掉——大家盯着 GPTBot 和 ClaudeBot,忘了抓得最勤的可能是隔壁那家。
名单之外的国内抓取程序,大概率识别不到
国内 AI 厂商的抓取程序不一定进了 Cloudflare 的已验证机器人目录,也不一定用固定且可识别的 User-Agent。落到免费方案上,它们就不会出现在爬虫表里,拦截清单自然也点不到。能做的只剩通用手段:看访问日志找出高频来源,用 WAF 自定义规则 按 User-Agent、ASN 或路径自己写规则拦。别指望那个下拉列表能替你解决所有问题。
这一切的前提是小黄云开着
官方在前置条件里写明:域名必须处于代理状态,流量真的经过 Cloudflare,这套东西才有意义。灰云记录的请求直接落到源站,边缘上再多规则也碰不到。国内站点常把一部分子域名走境内直连、一部分走 Cloudflare,这种混合结构下,AI 爬虫完全可以从没代理的那一侧进来。
还有个反直觉的好消息:免费方案不使用中国大陆境内节点,大陆访客要绕境外——但爬虫本来就多从境外发起,这条限制对拦爬虫几乎没有影响。看爬虫这件事上,境内没有节点不是短板。
动手顺序
只想要一条最短路径的话,按这个顺序走:
- 确认要保护的域名和子域名都开着小黄云,流量确实经过 Cloudflare。
- 进 AI Crawl Control 的 Crawlers 标签页,先只看不动,弄清楚到底是谁在抓、抓得多勤。免费方案只有 24 小时数据,隔几天多看几次。
- 去 Directives 看违规表,把无视你
robots.txt的那几个记下来——这批最该拦。 - 打开托管
robots.txt把话说明白,再在安全设置里按三类行为定下大方向。 - 回到 Crawlers 表,对第 3 步记下的那几个点拦截,留意这会占掉一条 WAF 自定义规则。
- 想再进一步,打开 AI 迷宫。最后回头检查已有的 WAF 自定义规则有没有和这套配置打架。完整步骤见 AI Crawl Control 快速上手 与 管理 AI 爬虫。
这几个开关和那张爬虫表都在 Cloudflare 仪表盘里;WAF 自定义规则的启停也能在 Orange Cloud 里随手切换,出门在外接到告警时方便些。
常见问题
Cloudflare 免费版能屏蔽 AI 爬虫吗?
能。按官方的方案对照表,免费方案就带 AI bot 策略、AI 迷宫和托管 robots.txt 三项,AI Crawl Control 也标注为「所有方案可用」。短板不在功能有没有,而在识别精度和数据保留:爬虫识别只按 User-Agent 字符串走,认得出的是那些自报家门的知名爬虫,指标页也只能看最近 24 小时。
写了 robots.txt 为什么还是拦不住 AI 爬虫?
因为 robots.txt 从设计上就不是拦截手段。Cloudflare 文档说得很直白:遵守 robots.txt 是自愿的,这个文件表达的是你的意愿,并不能在技术层面阻止爬虫访问内容,部分运营方会无视 Disallow 直接抓。要强制执行,得用 AI Crawl Control 或 AI bot 策略,它们在边缘就把请求挡掉。
屏蔽 AI 爬虫会影响百度和 Google 收录吗?
正常配置下不会。Cloudflare 把 AI 相关行为拆成搜索、代理、训练三类,你可以只拦训练那一类;托管 robots.txt 的名单里也只有 GPTBot、ClaudeBot、Bytespider、Google-Extended 这类 AI 专用标识,没有 Baiduspider 和 Googlebot。要留意的是混合用途爬虫——既做搜索又做训练的那些,会被所有屏蔽 AI 训练的配置一起拦掉。
AI Crawl Control 和「屏蔽 AI 机器人」开关有什么区别?
一个按爬虫点名,一个按行为分类。AI Crawl Control 给你一张实际来访过的爬虫清单,逐个选放行还是拦截;安全设置里的 AI bot 策略按搜索、代理、训练三类批量下判断。两者可以同时用。注意在 AI Crawl Control 里选拦截会占掉一条 WAF 自定义规则,免费方案总共只有 5 条。
2026 年 9 月 15 日 Cloudflare 的默认设置要怎么变?
按官方文档,从 2026 年 9 月 15 日起,Cloudflare 会给新接入的域名启用新默认值:归类为训练或代理的机器人在展示广告的页面上被拦截,搜索类保持放行。同时,兼做搜索与训练的混合用途爬虫会被所有屏蔽 AI 训练的配置拦掉,包括即将弃用的旧版「屏蔽 AI 机器人」开关。9 月 15 日前可以在安全设置里选择不采用。