在浏览器里打开你的官网,标题、参数、案例、常见问题全都在。但把同一串 URL 交给 AI 爬虫,它拿到的可能只是一片空白——它只读服务器第一次返回的 HTML,不会替你跑那一行 JavaScript。
麻烦的是它不报错:Search Console 正常,服务器日志有请求,只有 AI 引用一路是零。
三个爬虫的实测:JS 文件下载了,但没人执行
Vercel 分析过 GPTBot、ClaudeBot、PerplexityBot 这三个最常被提起的 AI 爬虫,结论很直接:没有一家会执行 JavaScript。ChatGPT 相关爬虫只有 11.5% 的请求会去取 JS 文件,Claude 的爬虫是 23.84%,取到也只是拿走,不会运行。
- Onely 2026 年 2 月的统计:42% 靠 JavaScript 渲染出来的内容,从来没被 AI 系统索引过。
- 同组的对照实验:只能通过 JS 导航到达的页面,GPTBot 和 ClaudeBot 的发现率都是 0%。
- 有家创业公司留下带时间戳的证据:把「给爬虫返回空壳」改成「返回真实 HTML」后,来自 AI 的引用从 0 跳到 101 条。
Google 不一样:Googlebot 会把页面排进渲染队列,用无头浏览器跑完脚本再索引,只是有延迟。所以传统搜索看着没问题,AI 那边什么都拿不到——「Google 能渲染」已经不是合格线了。
为什么后台看不出任何异常
这是一次静默失败。请求发出去了,状态码 200,浏览器打开完全正常,没有指标会报警。区别只在一件事上:那次响应返回的 HTML 里有没有正文。
判断标准压成一句:AI 看到的就是首次响应里的内容,之后靠前端补上去的都算没有。
| 渲染方式 | 头部返回的 HTML | AI 爬虫可见度 | 实现成本 |
|---|---|---|---|
| SSG 构建时生成 | 含完整正文 | 高 | 需要构建流程 |
| SSR 服务端渲染 | 含完整正文 | 高 | 服务器实时计算 |
| CSR 客户端渲染 | 空壳加一堆脚本引用 | 极低 | 低,但内容为空 |
五分钟自检:把 JavaScript 关掉再看一遍
三步就够:
- 用 curl 抓一次:在返回内容里搜正文里最有辨识度的一句话,比如某项参数或价格。搜不到,AI 大概率也搜不到。
- 禁用 JavaScript 看页面(或直接看源代码),确认正文、导航、内链还在不在。
- 检查内链:a href 真链接才算数,挂在点击事件里的跳转,对爬虫等于不存在。
顺手查折叠区:价格、规格、常见问题要是点开才显示,很可能也不在初始 HTML 里,属于同一类问题的另一种表现。
改造成本从低到高,按顺序做
- 内容页上服务端渲染或预渲染:Next、Nuxt、Astro 成本都不高;博客、文档、产品页直接静态生成更省心,首个字节还更快。
- 导航和分页换成真链接:站内发现路径要能在不跑脚本的情况下走通。
- 决策信息搬进初始 HTML:价格、参数、库存、售后规则、高频问答,别让脚本负责「创造」正文。
- 交互照旧保留:脚本用来增强体验没问题,但它不该是内容的唯一来源。
有一点要分清:会开浏览器的那类访客,比如 Chromium 内核的浏览器型 Agent,是能跑 JavaScript 的。所以不是「脚本全都没用」,而是内容页必须同时过得了最苛刻的那一类访客。
技术门没过之前,写的每篇稿子都只是往一个关着门的抽屉里塞东西。先让 AI 看得见,再谈它愿不愿意引用你。