做 GEO 的人手里大多有一张「排名→引用」曲线:检索结果里排第 1 的页面,被 AI 引用的比例有 85%,排第 5 的只有 43%。结论看起来顺理成章——往前挤位置,引用自然来。这个月 arXiv 上的一篇论文(CITECHOICE,9 月 14 日提交)专门用因果实验验证了这件事,结果把这条曲线的「杠杆属性」削掉了一大半。

看着很硬的差距,一换位置就没了

研究者的实验设置很贴近真实:让一个 GPT-5.4 智能体回答 129 个日常问题,发起 346 次检索调用,覆盖 1490 个文档,每次检索返回 5 条结果,答案平均引用 6 个来源。

先看观测数据:排第 1 的文档被引用 85.1%,排第 5 的只有 42.8%,相差 42.3 个百分点。这正是大多数引用报表画出来的那条曲线。

接着他们做了因果实验:把支持同一个事实的两个页面的位置对调,其他条件全部不动。结果位置效应从 42.3 个点缩到 7.9 个点;在 56 对单独交换的留出样本里,干脆是 0.0 个点。

原因是最普通的「选择偏差」:相关性高、质量好的页面本来就容易排到第 1,也因为同样的原因被引用。那条曲线把相关性的功劳记在了位置头上。

Google 那边也是同一笔账

同样的错位也出现在传统搜索层面。Ahrefs 2025 年 7 月测过,AI Overviews 约 3/4 的引用来自自然排名前 10;今年 3 月他们对 86.3 万个关键词、400 万条引用的复查里,这个份额掉到了 37.9%——排名 11 到 100 的贡献 31.2%,前 100 之外的还有 31%。

排名和 AI 引用都是「与问题相关性」的下游结果,谁也不是谁的原因。把首页当成引用开关,等于在解读一条自己正在变弱的曲线。

结构化排版:帮你多拿分,不帮你进场

论文还测了版式。同一篇内容做成两版——纯散文版,和带小标题、短段落、列表或表格的结构化版,事实与数据保持一致。结果:结构化版本每条答案多拿 0.50 个引用标记,但「是否被引用本身」的变化是 4.5 个点,置信区间横跨正负,作者自己都标为「未定论」。

换句话说:结构化排版帮已经在答案里的页面多分一点功劳,帮不了一个进不了答案的页面。想进场,靠的还是那条别人没有、可核查的具体事实。

顺手一提,这篇论文还有个对监测很有用的数字:同样的输入重新生成一遍,每条引用的二选一判断只有 85% 的一致率——什么都不改,七次里就有一次翻脸。只跑一轮就下结论的对比,多半在测噪声。

落到手上,改三件事

  • 把「排名→引用」图表当相关性的描述看,别当成往前进场的杠杆;想验证位置,就改一个页面、留一个对照,而不是看大盘曲线
  • 监测口径里把「进没进答案」和「进了拿多少引用」拆成两条线记,混在一张表里看不出哪个真的变了
  • 同一个问题至少重复跑几轮再报数;对改版前后的差异,先想想是不是那七分之一的随机翻转

那条 85% 的曲线没有错,错的只是读法:排第 1 不是因为位置所以被引用,而是因为它本来就该被引用。GEO 的力气,还是花在让页面「本来就该被引用」上。