看到 OpenAI、Anthropic 的爬虫,第一反应就是在 robots.txt 里补一行 Disallow——过去两年很多站长都这么干过。但这行字到底让流量涨了还是跌了,一直没人算过账。9 月 24 日,佐治亚州立大学的学者 Yu-Kai Lin 在 SSRN 上挂出了一篇实证研究,拿 GPTBot(492 家新闻网站)和 OAI-SearchBot(825 家)的每日 robots.txt 快照,结合 GPT-4o 的知识截止时间与 ChatGPT Search 上线这两个时间点做双重差分,把这笔账算出来了。结论对做品牌 AI 曝光的人很有参考价值。

先分清两种「用」:训练和检索是两回事

这篇研究的核心贡献,是把生成式 AI 使用网站内容的方式拆成了两条通道:

  • AI 训练:内容被吸收进模型参数里,影响的是模型「出厂」时会什么、知道什么。
  • AI 检索:用户提问时实时抓取并引用你的页面,决定的是答案里会不会出现你。

两条通道的流量后果完全不同,屏蔽决策也应该分开做。现实中不少站长的 robots.txt 是一刀切的——禁了训练爬虫,顺带把检索爬虫也禁了。

屏蔽训练爬虫:平均没影响,内容大户反而受损

研究发现,屏蔽 GPTBot 对网站流量排名没有可检测的平均影响。也就是说,怕「内容被拿去训练、自己吃亏」的担忧,在流量层面暂时没有数据支撑。

但有一个例外值得注意:内容储备丰富的网站,屏蔽训练爬虫后排名反而变差了。一个说得通的解释是,训练语料本身也是一种曝光路径——内容越多的站,从训练中获得的长期认知积累越多,主动退出损失就越大。

屏蔽 AI 搜索爬虫:平均掉 4.3%,非付费墙站最受伤

真正的分水岭在检索侧。屏蔽 OAI-SearchBot 的网站,流量排名平均恶化 4.3%,而且影响高度集中:

  • 非付费墙的开放内容网站受冲击最明显;
  • 内容储备少的网站也扛不住。

逻辑不复杂:ChatGPT Search 是一条实打实的分发渠道,你在里面被引用,就有读者顺着引用点过来。主动切断这条渠道,等于把曝光位拱手让给同行。付费墙网站反而影响小——它们本来就不指望开放流量,商业模式不依赖 AI 引流。

给品牌的实操:robots.txt 别一刀切

对做 GEO 的从业者,这项研究有三条直接可用的启示:

  1. 按爬虫分账管理。GPTBot(训练)和 OAI-SearchBot(检索)在 robots.txt 里是两条独立记录,决策也该独立做。训练侧可以谨慎放开,检索侧建议保持开放。
  2. 检索爬虫就是曝光入口。想让品牌出现在 AI 答案里,前提是内容能被抓到。屏蔽检索爬虫再谈 GEO,等于不装门面就想接客。
  3. 屏蔽决定要算流量账。情绪化地「拒绝 AI」很容易付出 4.3% 的排名代价,而换来什么,数据上目前看不出来。

当然要提醒一句:这是新闻网站的数据,平均效应不等于每个站的效应,复制到品牌官网时要打折扣看。

爬虫策略正在从「态度问题」变成「收益问题」。当有人把账算出来了,再凭感觉关门,成本就说得清了。


数据来源:Yu-Kai Lin(佐治亚州立大学),《Opting Out of Generative AI? Training Data, Search Visibility, and the Traffic Rankings of News Publishers》,SSRN,2026 年 9 月 24 日。