近期 Cloudflare 开放了 AI 爬虫管理选项,把爬虫请求分成 Search、Agent、Training 三类。根据消息,9 月 15 日后如果站点屏蔽了 Training 类,Googlebot 也可能被连带拒绝。这条新闻在 SEO 群里被转发了好几轮,但大部分人只当资讯看了。真正的问题是:很多团队已经在这种分类下直接勾选了“屏蔽所有非 Search 爬虫”,结果 Googlebot 恰好被归进 Agent 或 Training,导致抓取量一夜之间腰斩,排名两周后开始下滑。
这个错误的操作模式很典型——团队想省资源、防 AI 抓取,于是创建了一条全盘拦截规则,却没有搞清楚 Cloudflare 怎么给爬虫分类。而且排名下降后,大部分人第一时间去改页面、补外链、查内容质量,却没有翻过 Cloudflare 的设置。等我接到请求帮忙审计时,通常已经浪费了两三周。
这篇文章不讨论 Cloudflare 的新闻本身,而是把背后那个最容易被忽略的操作错误拆开:如何判断你的 Googlebot 已经被 Cloudflare 挡了,以及怎么修复。
1. 操作错误还原:为什么屏蔽 AI 爬虫会误伤 Googlebot
Cloudflare 的爬虫管理把请求分为三类:
- Search:搜索引擎爬虫(Googlebot、Bingbot 等)。
- Agent:代理类爬虫(比如一些 AI 搜索助手用来抓取页面的工具)。
- Training:训练类爬虫(用于训练模型的抓取)。
乍看很清晰:想保护 SEO 就放行 Search,想防 AI 就屏蔽 Training。但问题出在两点:
- 分类并不严格唯一——一些 AI 产品的爬虫 User-Agent 可能同时被划分到 Agent 和 Search 边缘,Googlebot 也可能在某些情况下被识别为 Agent(取决于 Cloudflare 的内部规则更新)。
- Cloudflare 的默认行为是级联的:如果屏蔽 Training,系统会自动将 Googlebot 标记为受限。这是新闻里提的 9 月 15 日默认规则背后的逻辑。
所以,大多数错误操作是这样的:在 Cloudflare 后台的 Security → Bots 里,直接打开“Block All AI Bots”开关,或者创建了一条 WAF 规则屏蔽包含“AI”关键词的 User-Agent。这种粗暴的做法并没有区分类别,连伪装成普通爬虫的 AI 训练工具会携带什么 UA 都不确定,最终连真正的 Googlebot 也可能被误杀。
2. 如何诊断:快速确认 Googlebot 是否被 Cloudflare 屏蔽
如果你发现搜索流量下降,但内容更新正常、手动检查 url 也能返回 200,那么优先怀疑爬虫访问权限。以下是四条诊断步骤:
步骤 A:登录 Cloudflare 检查爬虫管理页面
- 进入 Security → Bots → Bot Fight Mode 或 AI Crawlers(根据版本不同)。如果有“Allow”和“Block”的选项,查看当前 Search 类别是否被设为 Block,或者自定义规则中是否包含 Googlebot。
步骤 B:对比 Google Search Console 抓取数据
- 打开 Search Console → 设置 → 抓取统计报告。如果发现 Googlebot 抓取请求数在过去一周内出现断崖式下降,且时间点与你在 Cloudflare 上修改规则的时间吻合,基本可以确认问题出在访问权限。
步骤 C:用 Cloudflare 日志验证
- 在 Cloudflare 的 Analytics & Logs 中,过滤 User-Agent 包含“Googlebot”的请求,查看最近几天的状态码。如果大量返回 403、503 甚至 429,说明被 Cloudflare 拦截。
步骤 D:手动模拟测试
- 使用 curl 命令携带 Googlebot 的 UA 发送请求:
curl -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://你的域名。如果返回非 200 或者被重定向到拦截页面,说明防护规则误伤。
完成以上四步后,基本能锁定问题是否出在 Cloudflare 爬虫规则。
3. 修复操作:4 步恢复 Googlebot 访问
确认误杀后,不要急着删掉所有规则,按下面流程修复:
步骤 1:创建 Googlebot 绕过规则
- 在 Cloudflare 的 WAF → Custom Rules 中新增一条规则:
- 条件:
(http.user_agent contains "Googlebot") - 动作:
Allow - 位置排在最前面(优先级最高)
- 条件:
- 这样不管其他规则怎么拦截,Googlebot 都会被放行。
步骤 2:调整 AI 爬虫管理设置
- 回到 Security → AI Crawlers,确保 Search 类别为 Allow。Agent 和 Training 可以根据需求设置,但不要使用“Block all”选项。如果非要屏蔽 Training,请务必在第一点中已创建 Googlebot 例外。
- 如果使用的是 Bot Fight Mode,关闭它或切换到“Only block bots that are definitely malicious”(仅拦截明确恶意的爬虫),以免误伤。
步骤 3:提交 Google 重新抓取
- 修复后立即在 Search Console 中,对你认为重要的页面进行 URL 检查并“请求索引”。同时检查 Coverage 报告里是否有“被屏蔽”的报错。
步骤 4:设置监控告警
- 在 Cloudflare 的 Notifications 中配置对“爬虫规则变更”的告警。同时结合 Search Console 的抓取数据曲线,一旦再次出现异常下降能及时收到通知。
完整修复通常需要 15 分钟,但抓取量恢复可能需要 2-5 天,排名回升则需要更久。不过比起一直等下去,这 4 步是止损的最短路径。
4. 从这次错误中学到的:AI 爬虫管理的原则
- 别假设分类和你理解的一致。Cloudflare 的 Search/Agent/Training 定义是公开的,但实际匹配逻辑可能会更新。每年至少重读一遍官方文档。
- 内容更新策略的前提永远是爬虫能访问。哪怕你的内容再好,如果 Googlebot 被 CDN 拦在外面,一切等于零。所以在每周的 SEO 工作流中,加入一次“爬虫可达性检查”——可以用工具自动检测 Googlebot 是否得到 200 响应。
- 关注行业新闻但要解读实际影响。Cloudflare 的这个更新目的不是建议你禁用 AI 爬虫,而是给你精细控制权。只看到“封AI爬虫”就开始操作,就容易踩坑。
有些团队会用 Cloudflare 的“模拟”工具测试自己的规则,也有团队直接把问题甩给开发者去处理,然后就不管了。但从实际审计经验看,大部分误杀事件是因为运营者没有理解“分类”和“优先级”这两个概念。如果你正在用 Cloudflare,建议花 20 分钟把后台的爬虫面板从头到尾捋一遍。
FAQ
Q1: 我找不到 Cloudflare 的 AI 爬虫管理面板在哪? A: 这个功能目前是逐步推送的。如果你在 Security 菜单下没有看到相关选项,可以尝试更新订阅计划或暂时用 WAF 自定义规则来实现类似效果。
Q2: 屏蔽所有 AI 爬虫真的会影响 SEO 吗? A: 如果屏蔽了包括 Googlebot 在内的分类,会。否则,只屏蔽 Training 类别通常不影响当前排名,但 Agent 类别可能包含未来重要的搜索辅助爬虫(如 AI Overviews 的抓取),建议谨慎保留。
Q3: 我用的是其他 CDN(如 Fastly、Akamai)有类似风险吗? A: 其他 CDN 也有爬虫识别模块,但通常不会把 Googlebot 和 AI 爬虫强制绑定。不过,如果自行编写 WAF 规则时 UA 识别不规范,同样可能误封。原理是通用的:任何时候不要对包含“Googlebot”的请求应用拦截动作。
Q4: 修复后排名多久能回来? A: 抓取量通常 2-5 天恢复,排名回升则取决于 Google 重新评估页面的周期,一般 1-3 周。如果之前排名下降了而且没做其他负面操作,恢复速度会快一些。
Cloudflare 这次 AI 爬虫分类是一个很有价值的工具,但它从发布到被正确使用之间的落差就是操作失误的高发区。下次遇到搜索流量不明原因下跌,记住先翻翻 CDN 的爬虫日志。