做品牌的 AI 曝光,多数人盯引用、盯措辞,却很少想到一件事:AI 答案里的你有多新,取决于爬虫上次来你家时读到了什么。10 月 6 日,Google 把「降低 Googlebot 抓取速率」的官方文档重排了一遍,补上了 Retry-After 的写法示例。这回它把紧急刹车的价目表摆到了明面上——而这份价目表,现在直接记在 AI 答案头上。

紧急刹车的价目表

Google 只留了一个限流阀门:状态码。想让 Googlebot 急停,就返回 500、503 或 429,503 和 429 还要配 Retry-After 头(秒数或日期)。安全窗口很短:几小时到 1–2 天。文档里的警告就写在旁边——同一 URL 连续多天返回这些码,可能被直接移出索引。

就算没超窗,代价也列了三条:新页面被发现得少了;旧页面刷新变慢,价格和库存信息更晚反映到搜索里;已下线的页面在索引里滞留更久。

软手段一个都不存在:robots.txt 里的 crawl-delay Google 不认,Search Console 的限流工具 2024 年 1 月就下线了。

这份账单,AI 答案替你签收

AI Overviews 和 AI Mode 没有单独的爬虫,Googlebot 的索引就是它们的原料。官方要求写得很直白:页面要被索引、有摘录资格,才有机会作为辅助链接出现在 AI 功能里。

于是上面的副作用逐条变成 AI 答案问题:新做的对比页、报价页,在抓取恢复前没得引;AI 持续报你的旧价格、旧功能、旧政策;下架的页面还在被当依据;掉出索引的干脆没资格进答案。最难受的是这一切静默发生——AI 答案不会标注「这条信息旧了,因为你上周对爬虫回了 503」。限流忘了关,就是一场没人报修的可见度流失。

一刀切限流,先误伤用户触发的抓取

想限流的动机是真实的:Wikimedia 公布过自家的账——机器人占了 35% 的页面浏览,却贡献至少 65% 最贵的流量。很多站看到类似的数字,就上了全站一刀切的限速。

但各家爬虫听不同的口令:Googlebot 只认状态码,crawl-delay 当没看见;Bingbot 认 crawl-delay;ClaudeBot 支持非标扩展;OpenAI 对 crawl-delay、429、Retry-After 只字未提。

最要命的是 ChatGPT-User 这类用户触发抓取:真人正等着要答案,你的限流器回了 429——不是让它慢点来,是当场把你从那条答案里删掉。用限爬虫的方式去限用户抓取,起不到降速的作用,只起删自己的作用。

限流的正确姿势

  • 先验身份再限流:按官方 IP 段或反向 DNS 认爬虫,别信 UA 字符串;冒充的直接挡。
  • 用什么信号限什么爬虫:Googlebot 用 503/429 加 Retry-After;认 crawl-delay 的才用 crawl-delay。401/403 降不了速——429 以外的 4xx 对抓取速率无效。
  • robots.txt 永远不进限流规则:它对爬虫报错,Google 会停爬全站 12 小时,再拿旧副本顶 30 天。
  • 每条紧急规则带过期时间,并按天、按爬虫统计 429 和 5xx:关键页对 Googlebot 连续报错超过一天,按 AI 可见度事故处理,不是运维备注。

限流本身没错,错的是把紧急刹车当常驻配置。带宽省下的那点钱,AI 答案会按天从你的时效性里扣回去——而且不通知你。