如果你刚刚看到 Google 在 2026 年 6 月发布的 AI 搜索考量指南,可能已经注意到,官方首次系统性地讨论了 AI 爬虫、内容引用和结构化数据。但指南之外,一个更大的背景是——独立站面对的技术 SEO 基线正在持续抬高,而大多数网站的优化程度远远跟不上。

2025 年 Web Almanac 的数据揭示了几个值得关注的现象:基础安全协议、标签采用率持续上升,但仍有大量网站存在规范缺失、爬虫配置滞后、以及 AI 时代的 bot 管理盲区。这份检查清单就是基于这些真实数据提炼出来的,适合列入你的每周或双周 SEO 审计工单。

1. 基础协议与元数据:底线不能妥协

审查扫描工具和日志,确保以下元素在每一次发布和改版时都被验证:

  • HTTPS 覆盖 — 数据显示 Web 上 HTTPS 占比已超过 91%,但仍有接近 9% 的首页未启用。独立站应对所有页面(包括 HTTP 版本)重定向到 HTTPS,并在 CDN 层面检查证书链。
  • 标题标签(Title Tag) — 采用率接近 99%,但重点是每个页面是否拥有唯一且包含核心关键词的标题。批量检查是否有空标签、重复标题或超过 60 字符的截断。
  • Viewport Meta 标签 — 移动优先索引需要 viewport 存在且设置正确。确认 <meta name="viewport" content="width=device-width, initial-scale=1"> 出现在 all pages。
  • Canonical 标签 — 虽然规范采用率从 65% 微增至 67%,但仍有三分之一页面缺少 canonical。检查分页、参数生成 URL 是否都指定了 canonical。
  • HTML 验证 — head 元素错误率略有下降但不可忽略。用 W3C 验证器扫描首页和典型内容页,修复 head 内的嵌套错误。

2. AI 爬虫访问策略:从可选变成必选项

Robots.txt 已不再是只针对 Googlebot 的工具。数据显示,GPTBot、Claudebot、CCBot 等 AI 爬虫在 robots.txt 中的出现频率在过去一年增长了 55% 以上甚至翻倍。

  • 审查 robots.txt 中的 AI 爬虫指令 — 明确列出你允许或禁止的爬虫(如 User-agent: GPTBot Disallow: /)。注意大小写和语法错误。
  • 检查 robots.txt 返回状态 — 404 错误率下降至 13%,但仍可能发生。设置监控确保 robots.txt 正常可读取。
  • 考虑 llms.txt 的采用 — 数据显示 llms.txt 的采用率从极低跳升到 2% 以上,主要由插件(AIOSEO 占 39.6%)驱动。如果你使用 WordPress 且启用 AIOSEO,检查默认是否打开了 llms.txt。如果未使用,评估是否要手动创建。
  • 元机器人标签用法 — 只有 46% 的页面使用了 meta robots,且很多是默认值。建议在需要控制索引的页面显式写明 noindexnofollow,而非依赖 robots.txt 的 Disallow。

3. 结构化数据采用:从 SERP 奖励到 AI 原材料

Google AI Overviews 优先引用结构清晰的数据来源。FAQPage schema 的采用逆势增长,即便 Google 一度收缩了富摘要显示。

  • 审查现有 schema 类型 — 确认所有使用的结构化数据(FAQPage、HowTo、Article、Product 等)符合最新规范,并使用富结果测试工具验证。
  • 记录 FAQPage 的覆盖范围 — 检查已实施 FAQPage 的页面数量,测试它们在 Google 是否可以显示。如果已被降级,考虑改为 HowTo 或添加更多上下文。
  • 结构化数据与 AI 摘要的关联 — 虽然没有直接对应关系,但提供清晰的、有标注的内容会提高在 AI 搜索中被引用的概率。建议在策略性页面(定义、步骤列表)上优先部署。
  • 避免重复或无效标记 — 检查是否存在空标记、JSON-LD 格式错误、以及 not relevant 的 schema 类型(如对博客文章使用 LocalBusiness)。

4. 性能与加载属性:移动端差距仍在

移动性能进步缓慢,图像/iframe 的 loading 属性缺失率高达 67% 和 91%。这是严重影响用户体验和核心网页指标的两个易修复点。

  • 测试所有页面的移动性能 — 使用 PageSpeed Insights 记录首屏和重复加载分数。重点关注 Largest Contentful Paint (LCP)、Interaction to Next Paint (INP)。
  • 图像添加 lazy loading — 检查 <img> 标签是否有 loading="lazy"。对首屏以上的关键图像需要手动排除。
  • iframe 同样需要 — 高比例(91%)的 iframe missing loading attributes。对外嵌视频、地图等 iframe 统一添加 loading="lazy"
  • 检查 CDN 和缓存策略 — 配置适当的 Cache-Control 和 ETag,减少服务器响应时间。

5. 每周检查工作流建议

单次审计无法保证长期健康。建议将以上四个模块拆成四项“每日/每周”检查,集成到现有的内容更新流程中:

  • 星期二:基础元数据扫描 — 使用 Screaming Frog 或 Ahrefs 抓取新/更新页面,检查标题、描述、canonical、viewport。
  • 星期三:爬虫与结构化数据 — 通过日志分析 robots.txt 命中率,用 Google Search Console 监控结构化数据错误。
  • 星期五:性能与加载属性 — 重点监控 3–5 个核心页面,对比上周 LCP 变化,检查新增图像的 loading 属性。
  • 按月回顾 llms.txt — 留意主流 SEO 插件更新日志,若 llms.txt 成为“默认开启”则及时测试影响。

常见问题

Q:llms.txt 对排名有直接帮助吗? 目前没有证据表明 llms.txt 直接影响 Google 排名。它的作用是帮助 LLM 爬虫更快理解网站结构,可能影响 AI 摘要的引用率。是否实施可根据网站流量来源和 AI 工具的使用情况决定。

Q:如何发现我的内容被 AI 摘要引用? 可以用品牌+核心搜索词定期手动查询,观察 Google AI Overviews 是否展示你的内容。也可以通过 Search Analytics 报告观察“次数下降”是否与 AI 摘要出现相关。

Q:结构化数据是否会影响 AI 爬虫抓取? 结构化数据本身不会被用于训练模型,但它让内容更明确,有助于 AI 搜索工具提取答案。实施高质量的 structured data 是低投入、高潜在回报的优化。

Q:独立站多久应该做一次完整的技术审计? 至少每月一次。每周检查上述四个模块中的两项,可以避免堆积问题。如果刚经历网站迁移或 CMS 更新,应立即完成一次完整审计。

本文提供的检查点源自 2025 年真实网络快照,适用于持续优化技术 SEO 基线的独立站团队。将这些点固定在双周工单中,确保你的站点能在 AI 搜索时代保持竞争力。