被引用是 GEO 报表里最常看的数字,但最近一篇挂在 arXiv 上的论文给了这个数字一记提醒。研究者用 602 组受控问题,收了 21,143 条有效引用,逐条计算每张被引页面对 AI 答案的实际影响,结论很直接:引用多和影响大,是两个不相关的变量。页面被 AI 摆进参考名单,不等于答案里真的用了你的内容。
引用多不等于影响大
论文把 AI 可见度拆成两步:引用选择决定平台会不会把你列进来源,引用吸收决定你的内容被答案吸收了多少。Perplexity 每道题平均引 16.35 个来源,看着慷慨,但被引页面的平均影响分只有 0.0646;ChatGPT 每题只引 6.88 个,影响分却是 0.2713。差别在于 ChatGPT 更倾向把答案压在少数几张页面上。如果你的报表只数引用,量到的只是大门,屋里那本账还没翻开。
哪类内容真的被「用进」答案
论文给每条引用算了影响分,再对比含不同证据类型的页面。含代码的页面影响分高 76.9%,带数字和统计的高 61.6%,有定义标记的高 57.3%,有对比内容的高 55.3%,操作指南类高 41.2%。共同点很清楚:证据形态明确,AI 没法把话含糊转述掉——代码原样可搬,数字没法改写走样。这些不是让每篇都塞代码,而是说页面里最硬的那段证据,决定 AI 用你多深。
问答体这回反而拖了后腿
很多 GEO 教程的第一条建议就是把内容改成 FAQ 格式。这份数据里,Q&A 格式页面的影响分反而低 5.7%。论文的解释不客气:问答体只是外壳,问号标题不是证据。如果问句底下的答案又短又薄,套上格式也不会加分。数据里真正能解释影响差异的,是页面和答案的语义贴合度,它比字数更能说明问题——AI 吸收的是内容,不是排版。
给内容团队的三个动作
- 别只盯引用份额报表,抽几条真实答案出来,对照看自己的页面被复述了几句、复述的是不是你想说的。
- 把关键参数、对比表、可复用的片段写足写清,让 AI 有东西可以原样搬走。
- 别为格式改版式,为证据补材料:一个带数字的对比段落,比十个问答模块顶用。
论文自己也承认,影响分只是观测代理,不必当公式照搬。方向却是清楚的:GEO 的下一程,比的不是谁被引用得多,而是谁的内容能在答案里留下痕迹——被引用只是上了参考名单,被吸收才算真正写进了答案。