做 AI 可见度的人,每天盯的多半是"今天有没有被提到、有没有被引用"。但如果你去看自己服务器的爬虫日志,会发现一个更容易被忽略的问题:AI 来你网站上取料,目的从来不止一个。
把这件事拆开看,很多"说不清的现象"就有线索了。
100 次抓取里,只有 8.7 次是用户此刻在问
监测平台 Foglift 在 10 月 9 日更新的一份统计,把 262337 条被分类的 AI 爬虫请求按用途摆了出来(取最近 60 天窗口):
| 抓取用途 | 占比 |
|---|---|
| 训练数据 | 52.5% |
| 建立索引 | 38.9% |
| 用户提问时的实时抓取 | 8.7% |
一句话概括:AI 来你站上一百次,只有不到九次是"用户正在问、你正好被翻到"。剩下九十几次,发生在你完全看不到效果的时候。
一半以上的抓取,发生在"看不到效果"的时候
这组数字最实际的价值,是解释归因难题。很多人问:为什么某天 AI 里突然提到我了?为什么上周挺热、这周又没声了?
原因之一就在这张表里。训练与索引阶段的抓取占了九成以上,它们不会当天反映在答案里,而是先沉淀成模型与索引里的一层"印象",之后才在某次提问上冒出来。反过来,某次回答没引用你,也可能只是因为那次实时抓取没翻到那一页,而不是你内容不行。
所以"当天有没有被引用"更像体温计,不像体检报告。真正有提前量的指标是爬取结构的变化——训练和索引的占比在涨,说明品牌正在被"提前记住"。换句话说,你今天改的那段文案,改的很可能不是今天的答案,而是几个月后被调用到的素材。
内容要按"能被反复取用"来组织
既然抓取的大头在训练与索引,内容的目标就不该是"回答好某一次提问",而是被拆成足够多的、能被反复取走的小块。
同一份统计里还有两个数字可以作佐证:每一条被追踪的提问,平均会展开成 28.45 个衍生检索(样本为 3007 条原始提问、85543 条衍生检索);而 58115 条有效 AI 回答里,79% 至少引了一个来源。引用已经常态化,问题只是落在谁头上。这也带来一个直接推论:内容不必一次写全,但要保证每一块单独拎出来都是完整、可核验的。
落到做法上:
- 一个小标题下只讲一件事,别把"怎么选、多少钱、和谁比"混在一段里;
- 关键事实写成结论在前、可以直接摘走的一句话,少用"如上所述""详见下文"这类指代;
- 数据、参数、口径全站统一,同一件事别在不同页面上给出两个版本;
- 常见问题按"会被追问的顺序"排,而不是按你内部的产品目录排。
爬虫日志,建议加三个字段
最后落到监测侧:
- 把 AI 爬虫请求按用途分类(训练 / 索引 / 实时),而不是笼统记一个总量;
- 看趋势不看单日。训练与索引占比的周环比,比某天的峰值更有参考价值;
- 别把实时抓取当作全部。它只占 8.7%,用它来判断"AI 有没有在看我",会低估长期变化。
收个尾
AI 不是在你提问的那一刻才第一次认识你——它认识你的时间点,散落在过去几个月里那九成你看不见的抓取中。把爬虫日志按用途读一遍,再回头调整内容结构,比追着某一天的引用数跑要靠谱得多。