做 AI 曝光监测的人,最爱的就是报表里那行「你的页面被引用了 N 次」。但一条引用本质上是个承诺:答案里旁边那句话,出自你那个链接。最近有第三方测量团队把这个承诺拆开验了验,结论有点扎心——大概一半的引用,撑不住它旁边那句话。
引用是怎么被「验」的
Machine Relations 有个叫 Answer-Source Fidelity 的测量工具,每晚抓取 AI 答案里的引用来打分。流程分两步:先看这条引用能不能打开页面、能不能精确对到答案里的某一句话,这叫「可解析」;再判断被引的页面,是否真的支撑那句话的内容。打不开的、对不到具体句子的,都不计入评分。
9 月 19 日它发布了第一份冻结样本:10,066 条引用事件里,ChatGPT 的可解析引用 1,255 条,支撑率 54.8%;Perplexity 是 50.1%。Gemini 和 Claude 更麻烦,可解析率分别只有 9.0% 和 6.5%——大多数引用根本对不到具体句子,连评都没法评。
五倍样本,数字没动
冻结样本有个天然疑问:会不会只是一次快照的运气?9 月 26 日的新读数回答了这个问题。工具的另一条轨道是持续累积的实时队列,从 9 月 2 日跑到 9 月 26 日共 24 轮,ChatGPT 已积累 8,258 条引用,其中可解析 6,225 条——是冻结样本的五倍——支撑率 53.4%。
比 54.8% 低了 1.4 个百分点,落在两次抽样的正常波动范围内。这在测量上叫「复现」:不是一次性的偶然读数,而是稳定的结构性现象。换句话说,ChatGPT 的引用大约一半撑不住旁边那句话,而且样本越滚越大,这个比例也没在改善。
该盯的不是引用数,是引用句
这对做监测的人意味着什么?「被引用 N 次」只是个存在感指标,它不告诉你 AI 拿你的页面说了什么。按上面的数字,接近一半的情况下,说的不是你页面里那个意思。
具体可以这么补:把监测从「有没有被引」升级到「引用句说了什么」,定期抽样,把 AI 答案里引用你的那句话和你自己的页面逐句对照;硬信息优先核对——价格、数据、结论、资质,这类东西一旦被传错,用户会当成你的官方口径;发现被误引的页面,别急着庆祝流量,先看那句话错在哪、页面里有没有一句更「防误读」的写法可以顶上去。
被误引其实比不被引更麻烦。不被引只是缺席,被引错了是替你发言还发错了稿。
几个别读过头的限定
- 53.4% 只统计「可解析」的引用,打不开和对不到句子的都没算进去,真实全貌可能更糟也可能更好,目前没人知道;
- Perplexity、Gemini、Claude 目前只有 9 月 19 日的一次性快照,还没有第二轮复核,拿这几个数横向排座次为时过早;
- 这是第三方工具的口径,不是平台官方数字(该工具自己的校准证书显示与人工基准一致率 91.2%),读的时候留个心眼;
- 学术侧早有同方向的发现:引用「正确性」和「忠实性」是两回事,有研究测出过 57% 的引用过不了忠实性检验。这不是孤例,是行业反复撞见的同一堵墙。
引用量是可以刷的——平台反作弊已经盯上了这条路。但引用句对不对,刷不出来,只能靠内容本身写得清楚、不容易被读歪。GEO 的下一关,不是「被提到」,是「被说对」。