AI 爬虫读取网站的速度,正在脱离人类直觉。Cloudflare CEO 马修·普林斯(Matthew Prince)最近在一次访谈里给出判断:五年后,机器人流量会是人类流量的一千倍。这不是夸张修辞——就在几天前,一份服务器日志实测显示,单日 571 万次 AI 爬虫读取里,人类访问只是零头。

比数字更值得做 GEO 的人关注的,是访谈里的另一个信号:爬虫进门之前,可能要先报来意了。

出版商从「拉黑」走到「谈成协议」

过去两年,内容方和 AI 引擎的关系基本是拦截与绕过的猫鼠游戏。普林斯在访谈里透露了一个转折:大型出版商的态度正在软化。People Inc 的 CEO 两年前还在唉声叹气「我们还能怎么办」,上次见面两人已经在击掌——谈下来的授权协议明显好了很多。

这背后是筹码变了。Cloudflare 承载了互联网 20% 以上的流量,而 Google 的 PageRank 本质上是一棵从高信誉节点出发的连接树,这一大块要是被拦在门外,整棵树都会跟着出问题。内容方的拦截权,第一次从单纯的自我防卫变成了谈判筹码。

爬虫要声明「这次来干什么」

Cloudflare 之前推动 Google 把爬虫拆成两个:AI 一个、搜索一个。Google 以「全网要爬两遍、负载翻倍」为由拒绝,但给出了替代方案:爬虫每到一个页面,先声明自己这次要干什么,再由网站主决定允许哪些用途。在英国的一项裁决之后,Google 已表示会上这套机制,而且不止在英国。

普林斯的原话是:「我们最后可能会得到一个更强的 Web,坦白说,还有一个更好的 Google。」

真到那一天,授权就得拆开决策:

  • 「允许搜索引擎索引」不等于「允许 AI 拿去训练」
  • 「允许 AI 训练」也不等于「允许实时检索引用」
  • 三种用途、三种授权,混在一条 robots 规则里会吃大亏

对做 GEO 的人来说,授权就是曝光门票

这套机制落地后,你给不给某个 AI 爬虫进门,直接决定你的内容在不在它的引用候选池里。之前我们提过,读取量是先行指标、提及率是滞后指标——现在这个逻辑又多了一层:不授权,连被读取的资格都没有。

建议分三步走:

  1. 把 robots.txt 里现有 AI 爬虫的规则逐条过一遍,分清哪些是训练型、哪些是检索型;
  2. 检索型优先放行,它关系到用户此刻提问时你出不出现在答案里;训练型按业务决策,别一刀切全拦——拦了省不下多少带宽,反而可能让模型在「记忆期」就没记住你;
  3. 记录每次授权变更的时间点,之后看引用变化才有对照。

写给机器的内容,价值正在被重估

访谈里还有一组数字值得琢磨:《纽约时报》上每出现一个字,记者在别处大概写过一百个字;杂志上每张照片,同一个场景可能拍了五六十张。以前受版面和人类注意力限制,这些「废稿」发不出去;以后,它们可能都能卖给 AI。

对内容团队来说,这未必是坏事:被淘汰的素材、没发出去的深度版本,都可能是 AI 引擎愿意采信的信源。分发渠道变了,内容资产的定义也该跟着变。爬虫报来意的时代快到了,先把门禁和授权想清楚,比急着追任何新工具都实在。