做品牌 AI 曝光监测的人,多半碰过这种尴尬:报表显示品牌在 ChatGPT 里被提了,老板顺手在手机上问了一遍,名单里却没有你。以前只能归为「运气不好」,现在有研究把这事量化了:9 月中旬提交的一份预印研究测了一圈,同一个问题,换个环境跑,答案几乎对不上。
同一个购物问题,五个环境跑出平行世界
研究团队从 2,500 多条真实购物咨询里挑出 117 个商品问题,在 ChatGPT、Gemini 的网页 App 和各自 API,再加 Google AI Overviews 共五种环境下各跑三遍,收了约 1,536 份答案。
先看跨平台:ChatGPT 和 Gemini 回答同一个问题,引用信源平均只重合 5.4%,76.7% 的配对一个共同域名都没有。不是排序不同,是引用的网站根本就是两批。
再看同平台内部:同一问题问三遍,域名重合度 ChatGPT 约 26%、Gemini 约 30%,最稳的 AI Overviews 也只有 46%。这意味着截一张图就说「我们被 AI 推荐了」,证据力很弱。
真正的要害:App 和 API 不是一套答案
对买监测服务的人来说,更扎心的是这组数:ChatGPT 的 App 答案与 API 答案,信源重合度只有 12%,60.9% 的配对零共同域名;Gemini 稍好,也只有 14.8%。
而很多 AI 可见度监测工具恰恰走 API 抓数据——便宜、好脚本化。这组数据说明:API 测出来的答案,和用户在 App 里实际看到的,可能不是一套东西。
要说清楚的是,研究者没断言「界面」就是唯一原因——App 背后的模型版本无法确认,检索设置也不同。另外这轮测试是 9 月初在荷兰 IP、英文环境做的,样本偏实体商品,数字别当通用常数。但方向够明确了:拿 API 的测量去代表用户看到的世界,本身就是有偏差的近似。
三件事,把监测做扎实
- 问清工具的测量口径:走 App 还是 API?登录态、地区、语言是什么?这些条件不进报表,数字没法解释。
- 关键问题重复测:一小撮核心问题、固定条件、隔几天再测,看的是「稳定出现」,不是「出现过一次」。
- 各平台分开记账:5.4% 的跨平台重合度摆在那,「AI 可见度」合并成一个总分意义不大,ChatGPT 的成绩推不出 Gemini 的成绩。
还有个细节值得记:研究里 ChatGPT 在 79% 的商品答案中用「我会买……」这种第一人称推荐语气,Gemini 只有 7%。平台语气不一样,被点名的分量也不一样——记录提及的时候,顺手标一句它是冷冰冰列名单,还是开口替你说话。
AI 可见度监测刚起步,各家报表格式五花八门,但底层纪律是一样的:条件写清楚、重复测、分平台看。数据不完美没关系,口径糊涂才是真问题。