「信息增益」是这几年被引用最多的一个机制词:比竞品多说一点,AI 就会引你。于是八百字能说完的问题被撑成三千字。但这条说法真正的出处、Google 的一条专利,翻开细读,说的不是这件事。

那条专利到底写了什么

Google 2018 年 10 月提交、2022 年 6 月授权了一件专利,编号 US 11,354,342 B2,标题是《Contextual estimation of link information gain》。

它自己的定义是:一篇文档的「信息增益分」,指的是这篇文档相对于这位用户此前已经看过的文档,多出来的那部分信息。两个细节决定它被误用到什么程度:

  • 按人算,不按全网算。 同一页面对不同用户可以有完全不同的分数,取决于他这次会话里读过什么。
  • 比的是这次会话,不是你的竞品。 权利要求里比的是「已呈现给该用户的文档」与「新的一组文档」,不是你的页面和旁边的对手比谁更全。

而且这是会话内的相对判断,不是对页面质量的判决。2024 年,Search Engine Journal 的 Roger Montti 逐条读完权利要求后下的结论是:里面没有一句说「信息更多的页面应该排得更高」,也没有公开证据显示 Google 在 AI 概览或自然排名里跑这套分数。把「Google 描述过一个机制」换算成「AI 按这个规则选源」,是内容圈里最常见的一次跳步。

数据也不站在「写长」这一边

Ahrefs 拆了 560,346 个 AI 概览、1,677,876 条被引链接,筛出 174,048 个能解析正文的页面来算:字数与被引用、与引用位置的相关性都只有 0.04,等于没关系。

被引页面字数占比
少于 350 字16.6%
350–1,000 字36.8%
1,000–2,000 字30.6%
超过 2,000 字16.0%

一半以上的引用(53.4%)落在 1,000 字以下的页面,被引页平均 1,282 字;排在引用第 1 位的页面平均 1,270 字,反而比第 4 到第 10 位的 1,690 字更短。

真正的杠杆是模型自己说不出来的那部分

一份 GEO 机构的立场论文给了个说法:检索系统引用一个来源,取决于它比模型自己能生成的内容多出多少。作者把它叫「冗余问题」,不是质量问题——AI 写出来的文本在不同工具之间越来越像,留给人去补的缺口就小了。这篇论文的预测还没经过检验,作者也在卖它建议的那类服务,数字别当结论用。但方向与 Ahrefs 那组数据一致:能不能被引用,取决于你有没有说出模型说不出来的话。

  • 你自己的一手数字。 只有你才有的价格区间、交付周期、故障率、客户样本,带上口径和统计时间。
  • 具名的直接引用。 「某某在某场会上说」比「业内普遍认为」多一个可核对的对象。
  • 边界与例外。 什么情况下你的方案不适用——模型默认写普适优点,限制条件它补不出来。

今天就改的三件事

  • 把字数从验收标准里删掉。 改成按节验收:每一节有没有一句只有你能说出来的话。
  • 先问 AI,再看自己的页面。 找出 AI 回答里那句它自己就能写出来的话,跟页面对一遍——整节都在说同一件事,这一节就是冗余。
  • 清一次同题页。 把回答同一意图的三四页合并成一份,别让它们抢同一个引用位。

工具和术语会一直换,但有一条不会:先去读原始出处,再决定要不要照它改内容。