今年 8 月,一位开发者在给 AI 爬虫发请求时发现,同一个网址会返回两个版本:人打开是 1.4MB 的完整 HTML,机器拿到的是一份 32KB 左右的 markdown 精简版,里面还多出一段赞助 FAQ。页面属于 Time,插进去的是在线银行 Ally 的问答内容,广告技术方是 Mobian。
真正的关键不在广告,而在「只有一部分爬虫能拿到那一版」。按当时复现的测试,ClaudeBot、OAI-SearchBot、PerplexityBot 收到的是带赞助问答的 markdown;Google 的常规搜索爬虫拿到的,和普通浏览器完全一样;GPTBot 与 ChatGPT-User 则直接返回 406。
Perplexity 很快表态,其首席传播官向 Digiday 确认平台正在阻断这些广告进入索引,并称这种做法「具有欺骗性」。但 10 月 1 日 Digiday 的复盘显示,事情并没有停:Perplexity 的爬虫仍在抓取 Time,9 月是今年它访问 Time 最多的一个月;同时出版商已经把「AI 可见度」做成了对外售卖的产品,Future 有 30 多个客户,Ziff Davis 把它挂进品牌内容包里卖,德国三家出版集团和美国的 Axios、每日邮报也在试。
你的页面交出去的是哪一版
对品牌来说,这条新闻的落点不在出版商,而在「检索层拿到的到底是什么」。三个事实值得记住:
- 抓取程序不登录、不跑 JavaScript、按预算截断内容,它没读到的部分等于不存在;
- 机器版本可以被改写。赞助问答之所以有效,是因为它长得像「可以直接抽取的事实」,而引用最喜欢这类区块;
- 改写是有代价的。平台一旦把这种做法判定为欺骗,可能直接调整抓取协议,或者下调信源信任度。
先做一次机器版本自查
想让 AI 正确理解品牌,第一步不是写新内容,而是知道机器现在读到了什么。用爬虫身份把自己的核心页面拉一遍,逐项比对:
| 检查项 | 比对什么 |
|---|---|
| 正文完整性 | 浏览器版里的核心段落,机器版是否都在 |
| 事实一致性 | 价格、参数、资质、服务范围,两版是否同一套数字 |
| 技术依赖 | 关键事实是否只写在 JS 渲染或图片里 |
| 第三方页面 | 媒体、社区、榜单上关于你的内容,机器版有没有多出你控制不了的「事实」 |
做法很直接:把 User-Agent 换成 ClaudeBot 或 OAI-SearchBot,请求你最核心的几个页面,把返回体存下来,和浏览器里看到的逐段比。差异清单本身就是优化清单。
两条边界
第一,别让重要事实只活在人类看得到的版本里。首页轮播、图片里的资质、要点开才展开的参数表,机器一律读不到。
第二,也别在机器版本里塞只有机器看得到的东西。同一个品牌,两版口径一致,才是经得起反复核对的那一版;靠分叉版本换来的引用,随时可能被平台一句话收回。