做 AI 曝光优化的人,最近都养成一个习惯:遇到问题先问 AI。
「这个词为什么没被引用?」「竞品内容比我差,凭什么它在名单里?」这些问题以前要拉数据慢慢排查,现在把材料贴进对话框,几秒就能拿到一份像模像样的诊断。
值得一问的是,这份诊断可信度到底多高。一个叫 WARRANT-SEO 的新基准专门测了这件事,结论不太让人安心。
把决定性的那行删掉,模型就开始猜
这个基准的做法很干净:拿 27 个来自真实排查经验的 SEO 诊断场景,每个场景做成同一道题的三个版本。
版本一,把那条能排除其他解释的决定性证据交给模型,让它下诊断;版本二,证据不变,但把「仅凭这些看不出来」也放进备选,看模型会不会把能下的结论自己收回;版本三,只删掉那一行决定性证据,其余一字不改——这时候「信息不足」才是唯一正确答案。
27 个模型各跑三遍,共 81 道题、6561 条回答、6427 条计分,可靠性 0.969。
| 题目版本 | 模型的正确率 |
|---|---|
| 给足决定性证据 | 99% |
| 删掉那一行证据 | 51.5% 承认「信息不够」 |
只删掉一行,剩下近一半的回答依然给得出口气很足的结论——模型在没有证据支撑时,照样挑一个原因写成诊断。
还有一条更值得记:有些模型在同一道题下反复给出同一个没有证据支撑的答案。拿它做交叉验证时看着像「多方一致」,本质只是同一个猜测被重复了三遍。
为什么 GEO 诊断特别容易踩这个坑
GEO 的日常诊断和这个基准测的是同一类题。问「为什么我没被引用」,可选原因至少四五个:没被抓取、被抓但跑不了 JS、没被检索到、检索到但没被选上、竞品材料更完整。真正能一锤定音的证据往往只有一条——一份抓取日志、一次渲染快照、一组引用来源名单。
多数人提问的方式是手上有什么就贴什么,然后期待一个明确答案。
这里有个概念值得分清:知道和判断不是一回事。知道什么是 RAG、什么是实体识别,这是知识;能判断「眼前这份证据够不够支撑一个结论」,是判断。基准里前者分数普遍很高,后者才拉开差距——只有七个模型在这一点上拿到满分。
把诊断拆成「证据包 + 结论」两步
方法不复杂,核心是把顺序倒过来:先摆证据,再要结论。
- 提问前先列证据清单:至少固定四样——页面被抓取的状态、渲染后的正文快照、检索命中情况、AI 回答实际引用的来源列表。缺哪一样,就在提问里写明。
- 把「信息不足」写成合法答案:明确告诉模型「没有决定性证据时必须回答信息不足,不要给单一结论」。版本二测的是反面——有证据却弃答,同样是错。
- 同题跑多个模型,但别只看结论像不像:重点看有没有模型敢弃答。三个模型给出三个不同原因,往往比三个模型给出同一个原因更接近真实情况。
- 重复出现不等于正确:同一个答案被反复给出,只说明这个猜测稳定,不说明它有证据。
一个可以直接抄的提问模板
把下面这几句加在提问后面:
以下是全部可用证据(逐条列出)。请列出你认为可能的原因,并标注每一条原因对应哪几条证据。如果现有证据不足以区分某个原因,请直接写「证据不足」,不要给出单一结论。
拿到回答后,只把有证据支撑的那几条写进报告,其余当假设,下次采集再验证。
AI 做诊断确实省时间,它擅长把可能性列全。但判断这一刻证据够不够,是人的活。把证据摆在前面,把「不知道」留成合法答案,诊断才不会变成一份包装得很漂亮的猜测。