买血压计前先问一句 AI,已经是很多人的习惯。但 10 月 7–11 日在美国弗吉尼亚州阿灵顿举行的美国心脏协会(AHA)高血压科学年会上,一项初步研究泼了盆冷水:四款主流 AI 搜索工具里,三款判断「这台家用血压计有没有通过临床验证」的准确率只有 63%–83%,表现最好的 Google Gemini 是 86%–91%。研究第一作者、蒙特利尔大学的 Anna Soriano 说得直白——多数工具「只比每道题抛一次硬币好一点」。
这事看着是医疗圈的事,但做 AI 曝光的人该读一遍。它撞上的是一类常见又容易做砸的事实:资质与认证。这类事实的真值不在品牌自己的页面上,而在第三方注册库、登记表或检测机构的名单里;AI 又必须把它压成一句是或否的结论。
错得最多的地方,恰恰是「已通过」
研究测了 324 台家用血压计(179 台未通过准确性验证),四款工具各用三种问法反复问同一件事。
| 工具 | 判断认证状态的准确率 |
|---|---|
| Google Gemini | 86%–91% |
| ChatGPT / Copilot / Perplexity | 63%–83% |
数字之外,更值得注意的是偏差的方向:四款工具对「已认证」设备的识别,一律比「未认证」设备更差。
Soriano 的解释几乎能直接拿来做 GEO 诊断:很多情况下,AI 明明在官方网站里找到了这台设备的记录,却没把「被列进注册库」读成「已通过验证」。证据它看见了,结论没接上。
「上了名单」不等于「被读懂」
问题不在信息够不够,而在信息长什么样。注册库存的是名单、表格、编号,AI 要的是能直接抄走的结论句。
很多品牌的做法是「有据可查就行」:放一张证书扫描件,或者一行注册编号。人看着没问题,机器读到这儿卡住了——它看到一个编号,推不出「这台设备已通过验证」。
- 把结论写成完整句子,而不是只给编号或图片。例如直接写「XX 型号已列入 validatebp.org 验证清单」。
- 写全型号与品牌名。研究里连不太知名的型号也在同一份注册库里,写法不统一本身就是干扰。
- 给认证信息一个固定不变的地址,别塞在会改版的「资料下载」目录里。
同一道理适用于所有高门槛品类:医疗资质、金融牌照、检测报告、成分含量、售后条款。AI 不会替你推理,它只会替你转述已经写清楚的那句话。
同一台设备,换一天问就是另一个答案
研究者对结果不一致的设备做了复测:换一天、换一台电脑,向同一工具提同一问题,答案经常不一样。测试全程用隐私浏览模式,避免工具从之前的搜索里「学会」答案。
这条提醒很实际:单次检测不能当结论。 自查时同一个问题至少跨几轮、跨几天、跨不同入口各问一遍,稳定一致再下判断。一次答错也不必惊慌——那是取样问题,不是判决书。
该往哪改
这项研究的价值不在「AI 不靠谱」,而在于它指出了 AI 在哪类任务上失手:把第三方名单里的一条记录,翻译成一句是或否的结论。
给做 AI 曝光的从业者留三个动作:
- 先列清单:客户一定会问、AI 又必须给结论的那几个是或否事实——有没有认证、含不含某个成分、支不支持某项服务。
- 每个事实写一句能被整句引用的话,放进可抓取的正文,别只藏在图片、PDF 或表格里。
- 定期复测这几个问题的答案,重点盯「本来有、却被说成没有」那一类。
内容做得再多,如果最硬的那句事实没法被机器直接拿走,AI 就只能靠猜。这类问题上猜错一次,代价由客户买单。