做 GEO 的人这两年常被一个选择题折磨:要不要拒绝 AI 爬虫?拒绝吧,怕连搜索一起丢;不拒绝吧,内容又被白拿去训练。今年 7 月,Cloudflare 曾把这道题推到了极限——它宣布 9 月 15 日起,拒绝 AI 训练的网站会连带封掉 Googlebot、Bingbot、Applebot,理由是这些爬虫「既为搜索抓页面,也为训练抓页面」。站长们一度以为只能二选一。现在答案变了:9 月 15 日新方案生效,这道选择题被拆开了。
禁训练和留搜索,正式脱钩
Cloudflare 新增了一个「Disallow AI Training」选项:把拒绝训练的偏好写进 robots.txt,同时给 Googlebot、Applebot、Bingbot 这三家贴上「可问责(Accountable)」标签,保留它们的搜索访问权;OpenAI、Anthropic、Meta、Amazon 这些纯训练爬虫,照封不误。已有设置自动迁移,官方说法是「几乎在所有情况下,你什么都不用做」。
想连搜索一起挡掉?现在得主动去选「Block」——把混合爬虫赶尽杀绝从默认后果变成了刻意动作。方向反过来了:7 月是「禁训练就动搜索」,9 月是「动搜索要你亲口确认」。
为什么改口
一是用户用脚投票。Cloudflare 自己的数据:超过 20% 的网络流量跑在它上面,但只有 17% 的站点启用过某种 AI 训练阻止,愿意连搜索爬虫一起挡的不到 1%。训练可以拒,搜索不能丢,这是多数站长的真实排序。
二是账算得过来。按 Cloudflare CEO 今年 1 月给的数据,Googlebot 触达的独特 URL 数量是 OpenAI 爬虫的 3.2 倍——把它封了,等于亲手关掉自己最大的收录入口。另外,「可问责」不是白给的:三家厂商要承诺退出训练的机制、URL 级的抓取透明度,并保证退出训练不影响搜索排名。这才让「既禁训练又留搜索」在逻辑上站得住。
对做 GEO 的人,三件事要看清
第一,禁训练不等于禁 AI 摘要。 这是最容易搞混的一点。Google-Extended 只管 Gemini 的训练数据,管不了 AI Overviews 和 AI Mode——你的页面就算成功拒绝了训练,照样可能被拿去生成答案。指望靠一个开关守住 AI 曝光位,想多了。
第二,真正的增量是透明度工具。 按新方案,Google 的 URL 级工具承诺「数周内」推出,Apple 排到 2027 年。如果兑现,站长第一次能看到哪些页面被拿去训练、各自的搜索表现如何——这比任何偏好开关都值钱。
第三,robots.txt 的权威在被稀释。 Cloudflare 自己承认:一条 robots.txt「认不出谁在抓、为什么抓,也拦不住无视它的爬虫」。它的新方案本质是用网络层识别替代文件层声明。往后判断自己内容被谁取用,光看日志里的 user-agent 已经不够了。
一句话收束:这一轮反转最大的价值,不是 Cloudflare 善良了,而是把「搜索可见性」和「训练授权」拆成了两个独立决策。做 GEO 的人应该照着这个思路重新过一遍自家设置——别让一个没看懂的默认开关,替你做了本该由你做的选择。