「信息增益」是这几年被引用最多的一个机制词:比竞品多说一点,AI 就会引你。于是八百字能说完的问题被撑成三千字。但这条说法真正的出处、Google 的一条专利,翻开细读,说的不是这件事。
那条专利到底写了什么
Google 2018 年 10 月提交、2022 年 6 月授权了一件专利,编号 US 11,354,342 B2,标题是《Contextual estimation of link information gain》。
它自己的定义是:一篇文档的「信息增益分」,指的是这篇文档相对于这位用户此前已经看过的文档,多出来的那部分信息。两个细节决定它被误用到什么程度:
- 按人算,不按全网算。 同一页面对不同用户可以有完全不同的分数,取决于他这次会话里读过什么。
- 比的是这次会话,不是你的竞品。 权利要求里比的是「已呈现给该用户的文档」与「新的一组文档」,不是你的页面和旁边的对手比谁更全。
而且这是会话内的相对判断,不是对页面质量的判决。2024 年,Search Engine Journal 的 Roger Montti 逐条读完权利要求后下的结论是:里面没有一句说「信息更多的页面应该排得更高」,也没有公开证据显示 Google 在 AI 概览或自然排名里跑这套分数。把「Google 描述过一个机制」换算成「AI 按这个规则选源」,是内容圈里最常见的一次跳步。
数据也不站在「写长」这一边
Ahrefs 拆了 560,346 个 AI 概览、1,677,876 条被引链接,筛出 174,048 个能解析正文的页面来算:字数与被引用、与引用位置的相关性都只有 0.04,等于没关系。
| 被引页面字数 | 占比 |
|---|---|
| 少于 350 字 | 16.6% |
| 350–1,000 字 | 36.8% |
| 1,000–2,000 字 | 30.6% |
| 超过 2,000 字 | 16.0% |
一半以上的引用(53.4%)落在 1,000 字以下的页面,被引页平均 1,282 字;排在引用第 1 位的页面平均 1,270 字,反而比第 4 到第 10 位的 1,690 字更短。
真正的杠杆是模型自己说不出来的那部分
一份 GEO 机构的立场论文给了个说法:检索系统引用一个来源,取决于它比模型自己能生成的内容多出多少。作者把它叫「冗余问题」,不是质量问题——AI 写出来的文本在不同工具之间越来越像,留给人去补的缺口就小了。这篇论文的预测还没经过检验,作者也在卖它建议的那类服务,数字别当结论用。但方向与 Ahrefs 那组数据一致:能不能被引用,取决于你有没有说出模型说不出来的话。
- 你自己的一手数字。 只有你才有的价格区间、交付周期、故障率、客户样本,带上口径和统计时间。
- 具名的直接引用。 「某某在某场会上说」比「业内普遍认为」多一个可核对的对象。
- 边界与例外。 什么情况下你的方案不适用——模型默认写普适优点,限制条件它补不出来。
今天就改的三件事
- 把字数从验收标准里删掉。 改成按节验收:每一节有没有一句只有你能说出来的话。
- 先问 AI,再看自己的页面。 找出 AI 回答里那句它自己就能写出来的话,跟页面对一遍——整节都在说同一件事,这一节就是冗余。
- 清一次同题页。 把回答同一意图的三四页合并成一份,别让它们抢同一个引用位。
工具和术语会一直换,但有一条不会:先去读原始出处,再决定要不要照它改内容。