Google June 2026 的 SEO 更新带来了 AI Search Console 报告,同时 SERP 中 FAQ 结果的显示方式也在调整。但对独立站运营者来说,一个更隐蔽的变化正在发生:AI 爬虫的访问量正在大幅上升。
根据 HTTP Archive 数据,gptbot 和 claudebot 的出现在 robots.txt 中的频率一年内几乎翻倍,更多 AI 专用爬虫(如 petalbot、ccbot)也出现在排名靠前的网站中。很多站长的第一反应是“全都封掉”,或者反过来“完全不管”。这两种极端恰恰是当前最常见的操作错误。
本文不讨论 AI 爬虫的好坏,而是聚焦一个具体的操作失误:用一刀切的方式处理 AI 爬虫,导致要么浪费宝贵的带宽和内容,要么错失被 AI 产品引用的机会。以下是基于 2026 年 6 月信号的四步修正流程。
第一步:分离 AI 爬虫的意图
不是所有 AI 爬虫的用途相同。有的用于训练大模型(例如 gptbot 的公开目的是训练 OpenAI 模型),有的用于实时检索并生成答案(例如 Google 的 AI Overviews 使用的 crawler),还有的仅抓取用于索引增强。
操作错误在于:许多人在 robots.txt 中用一个 User-agent 规则覆盖所有 AI 爬虫,或者只区分了“普通爬虫”和“AI 爬虫”,却没有区分上述场景。
修正方法: 打开你的服务器日志(或使用 Search Console 的爬虫统计),按 User-agent 列出最近 30 天的访问记录。对照主要 AI 爬虫名单:
- gptbot:OpenAI 训练用
- ccbot:Common Crawl 公开数据集
- claudebot:Anthropic 训练用
- Google-Extended:Google AI 训练控制(2023 年已提供)
- Google 的一般爬虫(如 Googlebot)用于搜索索引和 AI Overviews
把每个爬虫标记为“训练型”或“检索型”。这一步是后续决策的基础。
第二步:根据意图制定差异化的 robots.txt 策略
default 的 robots.txt 往往只包含 Googlebot 和 Bingbot,很多网站忽略了新爬虫的显式声明。错误做法是:直接加入 Disallow: / 给所有未知 AI 爬虫,或者干脆不写导致默认允许。
修正方法:
对于训练型爬虫,如果你的内容不希望被用来训练模型(尤其是竞争对手训练的模型),可以分别禁止。例如:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
对于检索型爬虫(直接用于回答用户问题的),建议根据内容质量决定。如果页面已经被 AI 摘要覆盖并获得点击,可以允许以维持引用;如果页面流量主要来自传统搜索,需要权衡。目前 Google 并未强制要求允许某个爬虫才能获得 AI Overviews 收录,但允许 Google 爬虫不设限通常是安全的。
注意:crawl-delay 指令同样适用。给 AI 爬虫设置较高的延迟(如 10s)可以减少服务器压力,同时保留部分抓取。
第三步:用 llms.txt 提供精选内容替代完全封锁
2026 年 Web Almanac 数据显示,llms.txt 的采用率已超 2%,主要由 All in One SEO 和 Yoast 插件推动。这个文件本来是一个有争议的提案,但在实际操作中,它提供了一个中间方案:用精选的内容摘要满足 AI 检索需求,同时避免整个网站被随意抓取。
操作错误是:要么完全不用 llms.txt(错过控制机会),要么生成一个自动的、包含所有页面的 llms.txt(等于暴露全部内容)。
修正方法:
- 手动创建或通过插件生成 llms.txt
- 只放 5-10 篇代表高质量、有权威性的页面链接及摘要
- 保持更新——LLM 可能会定期拉取这个文件
这样,即使你很担心 AI 滥用内容,这个文件也能作为一个“官方许可”清单,让 AI 制作摘要时更倾向于使用你指定的材料,而不是随机抓取。
第四步:利用新 AI 报告验证调整效果
Google June 2026 更新提到的 AI Search Console 报告,会显示 AI 相关的展示量和点击趋势(如出现在 AI Overviews 中的次数)。虽然具体界面可能还在迭代,但你可以提前准备:
- 在 Search Console 中筛选“AI 搜索”类别(如果已可用)
- 对比调整 robots.txt 前后这些数据的波动
- 观察“页面被 AI 引用”的次数是否下降或上升
每一步调整后至少等待 7-14 天再评估,因为 AI 爬虫的拉取周期可能不同。
常见FAQ
Q:阻止所有 AI 爬虫会影响 Google 搜索排名吗? A:目前没有证据表明阻止训练型爬虫会影响传统搜索排名。但针对 Google 自身的爬虫(Googlebot、Google-Extended),建议保持允许,因为它们与搜索索引和 AI Overviews 内容直接相关。
Q:我的网站很小,还需要管理 AI 爬虫吗? A:建议至少检查日志。如果 AI 爬虫占用了大量带宽而没带来任何价值(如训练爬虫没有产生引用),可以限制它们。一个小错误可能让服务器成本上升而不自知。
Q:llms.txt 会被所有 AI 产品遵守吗? A:不是。目前只对部分主动支持的产品有效。但它是一个低成本的信号,表明你欢迎 AI 检索特定内容。2026 年后,更多框架和插件会默认启用它。
Q:如果不做任何调整,会有什么后果? A:在 AI 爬虫数量持续增长的趋势下,不做任何调整意味着你放弃了选择权。未来你的内容可能被训练为竞争模型,或者被 AI 摘要跳过而没有正确归因。现在花 30 分钟配置,可以减少后续的补救成本。
以上四步覆盖了从诊断到执行、再到验证的完整闭环。核心思路不是“拒绝 AI”,而是“管理 AI”——这是 2026 年独立站 SEO 必备的实操能力。
常见问题
问:如果我现在就要围绕《Google June 2026 更新后,AI 爬虫管理的常见错误与修正步骤》这类主题动手,第一步该做什么?
答:先确认目标关键词当前的搜索结果页在奖励什么内容格式,再决定是补充结构、更新信息还是重写标题与摘要。
问:这类内容多久复查一次比较合适?
答:如果主题变化快,建议每周复查;如果是长期稳定主题,至少每两周检查一次排名、点击率和结果页特征变化。
问:重写时最容易忽略什么?
答:最容易忽略的是搜索意图是否已经变化,以及竞争页面是否通过更完整的结构、更新的数据或更强的可读性拿走了点击。