第三章 · GEO 真正能改变什么,不能改变什么

智能体时代的营销 · Canlah AI · 新加坡 SEO + GEO 机构

3.1 先说最强的反方意见

2026 年 7 月 15 日,一篇覆盖 45 项 GEO 研究的批判性综述给出结论:在其审阅范围内,没有任何一项技术展示出稳定的、纵向的、跨平台的、对有机可发现性或下游行为的因果效应(arXiv:2607.14035,A−,单作者预印本)。

我们把这句话放在本章开头,而不是藏在脚注里,原因有三:

其一,任何具备判断力的采购方都会在一次搜索之内找到它。先被对方拿出来,和自己先拿出来回答,是两种完全不同的处境。

其二,它基本上是对的。下文将说明我们在哪一点上认为它需要限定 —— 但那是一个范围限定,不是一个反驳。

其三,这篇综述的存在本身,就是本报告第四章测量规范的正当性来源。 如果因果效应至今未被稳定证明,那么继续售卖”排名提升”的产品就是不诚实的。

那么在因果尚未被证明的前提下,还剩下什么是可以负责任地交付的? 三件事,而且都可验证:

  1. 事实层面的错误可以被发现并修正。 AI 答案中关于你的品牌的错误陈述 —— 说你未开业、把你和同名企业混淆、把你与不可控的第三方内容关联 —— 是客观事实错误,不需要任何因果理论就能判定对错。我们在真实案例中观察到 API 层稳定输出”该店未开业”,而浏览器层同期输出正确信息(4.6 星、541 条评论)。这类问题的修复与验证都不依赖”GEO 是否有效”这个命题。
  2. 缺口是可测量的,而且不是概率性的。 你的商品页有没有结构化数据,是一个二值事实,不是一个相关性推断。第零章那张表里的每一格都可以在你自己的站上复现。
  3. 我们无法证明因果,所以我们改用预注册对照。 在任何持续项目中,我们在动手前公布提示词面板与判定规则,设置不做优化的对照组,结果无论达标与否都向客户完整公布。这不能替代因果证明,但它把”你花的钱有没有产生变化”这个问题从供应商的说辞变成了双方事前约定好的判据。

诚实的产品定义因此是:我们卖诊断、修错与受控实验,不卖排名承诺。 这个范围比行业通行的说法小,但它里面的每一项都能在交付时被你验证。

3.2 那个”40%“到底是什么

被广泛引用的”GEO 可提升可见度 40%“,出自普林斯顿等机构 2023 年的工作、发表于 KDD ’24(arXiv:2311.09735,A,本报告引用的唯一同行评审文献)。这个数字需要三重限定:

  1. 它测的是引用份额,不是可发现性。 该研究的实验管线是:先由 Google 搜索检索出前 5 个来源,再由模型综合生成带引文的答案。也就是说,内容能否进入候选集是给定的前提,优化只作用于”进入候选集之后是否被引用”。这与第 3.1 节那篇综述的结论并不冲突 —— 二者测的是漏斗的不同段。
  2. 模型是 GPT-3.5 时代的。 该研究的生成环节使用 GPT-3.5-turbo。截至本报告撰写时,我们未找到在 2026 年主流模型上对其主要效应的独立复现。这是本报告最重要的一个已知缺口。
  3. **“40%”与”37%“是不同口径。** 37% 那个数字来自 Perplexity 上、由大模型评判的”主观印象”评分,样本为 200 例子集;位置加权词数(PAWC)口径下的增益为 9–22%。引用时须指明口径。

3.3 均衡效应:必须成对引用

该研究中最具销售价值的一条是所谓”均衡效应”:原本排名第 5 的站点,通过”引用来源”这一项优化,AI 可见度提升 +115.1%

这条被广泛引用,但几乎从不与它的另一半同时出现:在同一实验条件下(全部来源均优化),原本排名第 1 的站点下降 30.3%。

本报告规定:+115.1% 永不单独出现。 只讲前一半,是把一个零和再分配描述成了增量创造。诚实的表述是:GEO 在候选集内部重新分配引用份额,它系统性地有利于中后位者、不利于领先者 —— 这对挑战者品牌确实是好消息,但机制是再分配,不是增长。

3.4 关键词堆砌是负收益 —— 这个数字是对的

该论文第 6 节表 5 显示:关键词堆砌在 Perplexity 上的表现比基线低约 10%(PAWC 21.9 对基线 24.1,即 −9.1%)。

撰写本报告过程中,一轮自动化研究曾提出”原论文并无负值,应改为’几乎无提升’“。该修正经复核被驳回 —— 原始表格确实给出负值,提出的”修正”本身是错误的。我们保留这一记录,是因为它例证了本报告卷首的判断:在这个品类里,错误传播的方向是双向的,包括朝着”更保守”的方向传播错误。 逐条回到一手来源是唯一可靠的做法。

3.5 那么什么是有效的

把第 3.1 至 3.4 节的限定叠加起来,剩下的可辩护结论比通常的 GEO 清单短得多,而且重心完全不同:

发现环节与引用环节必须分开处理。 一项针对 ChatGPT 的研究给出了迄今最刺眼的一组对照(A−,预印本):当查询中点名品牌时,模型对其召回率为 99.4%;而在不点名的品类查询中,该品牌被主动发现的比例仅为 3.32%。同一研究中,站内 GEO 评分与被发现率不相关;在 Perplexity 上呈现正相关的是引荐域名数(r = +0.319)与 Reddit 存在度(r = +0.395)。

另一项包含约 25.2 万次试验的研究显示:仅做格式层面的改写,效果基本为零。

三条结论:

  1. 站内优化决定”被检索到之后是否被引用”,站外资产决定”是否被检索到”。 后者的权重更大,而绝大多数 GEO 服务卖的是前者。
  2. 纯格式化改造(加小标题、加问答块、加 schema)不足以改变结果。 它是必要卫生,不是杠杆。
  3. 第三方提及与引荐域名是目前相关性最强的可操作变量。 这把 GEO 的重心从内容生产推向了公关与社区 —— 这也是为什么第七章的九十天序列把”站外权威”排在”站内改造”之前。

本章的诚实结论:GEO 能可靠改变的,是已被检索到的内容是否被引用,以及在候选集中的相对份额。我们尚未能证明它可以稳定改变内容是否被检索到、或产生持久的下游流量 —— 据我们所知,也没有人证明过。因此我们把承诺限制在这个范围内,并用预注册对照来检验每一次具体投入是否奏效。


本报告全文免费公开。如需 PDF 版本(便于转发与归档),请在 /whitepaper 留下邮箱获取。