做 GEO 的人有个默认假设:手法有效,引擎不设防。这个月,两篇 arXiv 论文把另一面摆上了桌——生成式搜索完全可以装一道「防线」,专门识别被改写过的文档,把它从答案的引用名单里压下去。部署还没发生,但可行性已经被证明,做内容的人值得提前看一眼。
先说结论:防线是真有效的
第一篇叫 GEO Defender(arXiv 2609.02964)。研究者测了 7 种已发表的 GEO 攻击手法、5 个模型(包括 GPT-5.5 和 Claude Opus 4.8),在没装防线时,平均攻击成功率是 50.32%——也就是说,改写过的文档有一半概率能撬动答案。装上防线后,这个数字掉到 6.20%,而正常内容的证据使用率还保住了 94.12%。更值得记的是:防线只见过 36 个构造样本,对 4 种从没见过的攻击手法照样兜得住。
另一篇 Counter-GEO-Bench(arXiv 2609.02316)测的是「掺假改写」:247 条人工核验的问题里,一篇普通文档经过 GEO 手法包装,掺进假权威、假引用和「时效性」框架之后,能把三个开源模型的答案往假结论上带,平均 55.7% 的成功率。这些数字都来自受控实验,不是线上真实数据——但足够让引擎方看到动手的理由。
为什么现在的过滤器拦不住
有人会问:引擎不是早就有安全护栏吗?论文也测了,Granite Guardian、Llama Guard 3、NeMo 自检这套现成防线,最多把攻击成功率压掉 5.7%,其中一家的降幅还不显著。
原因不难理解:安全分类器找的是违规内容——仇恨、欺诈、危险指令。而 GEO 攻击文档恰恰绕开了这些:它与原文事实一致、语言流畅自信、信息量看起来很足,正是分类器照单放行的类型。这给从业者提了个醒:被引擎判定为操纵的内容,未必是假内容,也可能是真内容被改写到了不该在的位置。
防线认的是「写法指纹」,不是真假
两篇论文的防线各有路数。C-GEO Guard 靠风格相似度,把检索到的内容块和已知攻击特征做比对;GEO Defender 的重排器学了一个偏好:原始文档就该排在它的 GEO 改写版前面。
问题也出在这。风格指纹分不出恶意和诚实——信息保真的诚实改写(每个事实都没动,只调了语气和结构),被 C-GEO Guard 拦掉了 2.16%,对照组只有 0.29%。数字不大,方向扎心:防线调得越狠,带着同款指纹的老实页面被误伤得越多。最像指纹的写法包括:夸张的权威话术、引用形状的断言、还有「截至今年」式的时效包装。
三个可以现在就做的动作
- 少用模板腔。 如果你页面的写法和量产 GEO 工具的输出长得一样,就等于共享同一条将来会被打击的特征。手法可以用,别用得一眼假。
- 留一手证据。 一手数据、实测记录、可核验的原始出处,是改写版本最难伪造、也是防线明确偏好的部分。
- 复核「被用对没有」。 引用率升高时,同时抽查答案有没有忠实转述你的内容。被引用却被曲解,比不被引用更麻烦。
GEO 这门手艺的生命周期,一向由引擎侧的攻防节奏决定。这两篇论文还停在研究阶段,但方向已经写明白了:往后拉开差距的,不是谁改写得更用力,而是谁的页面看起来更像「本来就值得被引用」。