白皮书 · 第 6 / 13 篇全文在线版
第三章 · GEO 真正能改变什么,不能改变什么
智能体时代的营销 · Canlah AI · 新加坡 SEO + GEO 机构
✓你正在读的就是完整正文,不是摘要 —— 全书 13 篇全部免费在线公开,无需注册。PDF 只是同一份内容的打印版。
3.1 先说最强的反方意见
2026 年 7 月 15 日,一篇覆盖 45 项 GEO 研究的批判性综述给出结论:在其审阅范围内,没有任何一项技术展示出稳定的、纵向的、跨平台的、对有机可发现性或下游行为的因果效应(arXiv:2607.14035,A−,单作者预印本)。
我们把这句话放在本章开头,而不是藏在脚注里,原因有三:
其一,任何具备判断力的采购方都会在一次搜索之内找到它。先被对方拿出来,和自己先拿出来回答,是两种完全不同的处境。
其二,它基本上是对的。下文将说明我们在哪一点上认为它需要限定 —— 但那是一个范围限定,不是一个反驳。
其三,这篇综述的存在本身,就是本报告第四章测量规范的正当性来源。 如果因果效应至今未被稳定证明,那么继续售卖「排名提升」的产品就是不诚实的。
那么在因果尚未被证明的前提下,还剩下什么是可以负责任地交付的? 三件事,而且都可验证:
- 事实层面的错误可以被发现并修正。 AI 答案中关于你的品牌的错误陈述 —— 说你未开业、把你和同名企业混淆、把你与不可控的第三方内容关联 —— 是客观事实错误,不需要任何因果理论就能判定对错。我们在真实案例中观察到 Gemini grounded API 通道连续三天稳定输出「该店未开业」,而浏览器层同期显示已营业(4.6 星、543 条评论;Google Places 权威记录为 541 条)。完整时间线、对照组,以及这个案例证明不了的部分,见下方走读。这类问题的修复与验证都不依赖「GEO 是否有效」这个命题。
- 缺口是可测量的,而且不是概率性的。 你的商品页有没有结构化数据,是一个二值事实,不是一个相关性推断。第零章那张表里的每一格都可以在你自己的站上复现。
- 我们无法证明因果,所以我们改用预注册对照。 在任何持续项目中,我们在动手前公布提示词面板与判定规则,设置不做优化的对照组,结果无论达标与否都向客户完整公布。这不能替代因果证明,但它把「你花的钱有没有产生变化」这个问题从供应商的说辞变成了双方事前约定好的判据。
诚实的产品定义因此是:我们卖诊断、修错与受控实验,不卖排名承诺。 这个范围比行业通行的说法小,但它里面的每一项都能在交付时被你验证。
走读 · 一个事实错误的完整时间线
上面第 1 条说「事实层面的错误可以被发现并修正」。下面把我们手里那个案例完整摊开:它是怎么被发现的、每一步的证据长什么样、我们做了什么、以及它证明不了什么。品牌、域名、地址按我们打码样本的口径处理(客户实体 → ▓▓▓▓▓▓);样本口径本允许保留媒体来源,但本案唯一的媒体来源能直接反查出客户,所以一并隐去。全部数据为 Canlah 一手,原始 JSON 在内部证据包,客户可在委托时逐份打开。
背景。 新加坡一家餐饮集团 ▓▓▓▓▓▓ 旗下的屋顶酒吧 ▓▓▓▓▓▓,2024 年下半年开业,到 2026 年 7 月已营业超过一年半。我们在 2026 年 7 月 10 日对该集团做审计时,问了三种问法的同一个问题:「这家集团在新加坡有哪些餐厅?」
时间线。
| 日期 · 时刻(SGT) | 引擎 / 通道 | 层 | 观察到什么 | 证据形态 |
|---|---|---|---|---|
| 07-10 18:40 | Google Places API | 权威层(唯一可裁) | openNow=true、4.6 星、541
条评论、primaryType=bar |
原始 JSON(Places 字段) |
| 07-10 18:54–18:56 | Gemini 2.5 Flash + google_search grounding | API 层 | 3/3 样本写「the upcoming ▓▓▓▓」「set to open」,即「该店尚未开业」 | 3 份原始 JSON,含 groundingSupports 逐句锚定 |
| 07-10 同批 | OpenAI 网页搜索通道 | API 层 | 3 个样本没有「未开业」;其中 2 个样本根本没提到这家酒吧 | 3 份原始 JSON |
| 07-11 23:49–23:52 | 复测矩阵,12 次调用、5 组对照 | API 层 | 见下方「五组对照」 | 12 份原始 JSON + 汇总 JSON |
| 07-12 凌晨 | Google AI Mode(登录态真实 Chrome) | 浏览器层 | 卡片逐字:「4.6 (543) Bar」「Open」,正文用现在时描述 | innerText 逐字提取(截图留在浏览器扩展侧,未归档进本案证据包) |
| 07-12 12:44 | Gemini 2.5 Flash + grounding,同窗再跑 | API 层 | 仍写「upcoming」,且自述「as of a September 2024 report」 | 1 份原始 JSON |
543 与 541 相差 2 条评论,是两天之间的自然漂移,反过来确认浏览器层和权威层看到的是同一实体。
五组对照(07-11)。 我们没有停在「API 说错了」,而是拆它为什么错:
- A · 同模型、同三个问法、开搜索:3/3 仍写「upcoming」。第二个样本甚至写出「upcoming(as of late 2024)or recently opened」这种自相矛盾的对冲——典型的照抄旧片段。
- B · 同模型、关掉搜索:3/3 答案里这家酒吧根本不存在,模型自报知识截止「late 2023 / early 2024」。所以「未开业」这个词不可能来自模型的参数记忆——记忆里连这个词条都没有。
- C · 换更强的模型(gemini-3.1-pro-preview)、同工具同问法:2/2 零「upcoming」,全部现在时,两个样本分别自发发出 6 条和 8 条交叉验证查询。
- D · GPT-5.4 + 网页搜索:2/2 零「upcoming」;但第二个样本把两家不在集团官网概念页名单上的餐厅算进了集团。GPT 侧的风险形态是误归属,不是过时。
- E · 同 Flash 模型,把问题改成「▓▓▓▓ 现在营业吗?」:2/2 立刻回答「currently open」并给出营业时间,引用源里出现了品牌自己的域名 ▓▓▓▓.sg 和场馆方的域名。
根因(由证据锚定的部分,与我们推断的部分分开写)。
三份 07-10 原始 JSON 的 groundingSupports
把每一句「upcoming」都锚定到同一个检索片段:一家本地主流英文媒体的页面(另有一句同时锚定到集团官网的概念页)。我们在
07-11 解析跳转链,确认该页面是 2024 年 9 月 29 日发布的开业前报道;2026
年 9 月 1 日重开原文,「the upcoming ▓▓▓▓, a Mediterranean-inspired
rooftop cocktail bar and lounge」这句仍在,与 AI
答案近乎逐字相同。需要说明的局限:JSON
里的跳转链已过期,今天无法再从原始文件直接复现这一步,只能靠当时的解析记录加原文重开。我们随后抓取集团官网全站,用
upcoming|set to open|coming soon 检索:0
命中——AI
不是被客户官网喂了「未开业」。但官网概念页对这家酒吧只有一句话「New chic
rooftop dining lounge bar located at the ▓▓▓▓」外加一个 logo(2026 年 9
月 1 日再次抓取,文案未变),品牌子站正文极薄,而这句「New」本身就是被
AI
同时引用的那段文字。公开网络上关于它最「权威」的一段描述,至今仍是那篇开业前旧稿,官网没有提供任何能压过它的内容。这是内容真空,不是文案错误。
浏览器层为什么对——这一段是我们的推断,依据是 Gemini API 文档而不是实测:文档写明 API 侧的 google_search grounding 只接网页文本索引,Google Maps 的结构化数据(营业状态、评分、评论数)是另一个默认关闭、单独计价的工具;而 Gemini 网页端与 AI Mode 看起来融合了这层实体数据。同一屏幕、两条管线、两个答案——这个现象是实测的,管线解释是推断。
我们做了什么。 07-10 的审计报告给出的处方是语料侧的:在品牌自己的域名上放一段机器可读的「已开业」叙述(现在时、营业时间、地址)并加结构化数据,让新鲜内容有机会压过旧稿;E 组已经证明这个域名本身是可被引用的,缺的只是内容。我们还没有做的是:修正。 我们没有执行过这项修正:2026 年 9 月 1 日再次抓取,集团官网概念页对该酒吧的描述仍是同一句「New …」,内部档案里也没有任何修正后的复测记录。本案例只有诊断记录;「修正 → 复测」这一环未纳入本报告,我们不用 E 组或 C 组的结果来冒充它——那是换问法、换模型,不是改语料。
这个案例证明什么。
- 事实错误的判定不需要任何因果理论。Google Places 的营业状态字段是可裁的权威,AI 答案对它要么对、要么错。
- 错误是稳定的,不是随机抖动。同一模型、同一通道,7 月 10、11、12 三天 3/3、3/3、1/1 复现。
- 错误来自检索到的旧语料,而不是模型旧知识(B 组)。这决定了修复杠杆在语料侧,而不是「等模型更新」。
- API 层与浏览器层在同一时段给出相反答案。任何只用 API 做的「AI 可见度监测」,在这个事实上会给客户一个错误的安心或错误的恐慌。
- 「AI 说错了」这句话必须带三个限定才有意义:哪个模型、哪一层、哪种问法。换任一项,答案都变。
这个案例不证明什么。
- 它不证明「发布内容就能修好」。修正后复测未做,我们不知道新内容需要多久、能否压过一篇挂了 21 个多月的旧稿。
- 它不证明浏览器层是事实基准。同一 AI Mode 屏幕把该集团一家我们有理由认为已停业的餐厅列为现役;该餐厅的 Places 记录未归档进本案证据包,所以我们对它不下结论,只指出:两层各有各的陈旧,谁都不是真相。
- 它不证明 GEO 的因果效应。这是一个品牌、一条事实、一个通道上的诊断,样本量是 1。它能说明的是「这类错误可以被定位到具体来源」,仅此而已。
- 它不适用于所有引擎。OpenAI 通道在同一问题上没有说「未开业」,它的问题形态是漏提与误归属——修复动作不同,不能用同一张处方。
3.2 那个「40%」到底是什么
被广泛引用的「GEO 可提升可见度 40%」,出自普林斯顿等机构 2023 年的工作、发表于 KDD ’24(arXiv:2311.09735,A,本报告引用的唯一同行评审文献)。这个数字需要三重限定:
- 它测的是引用份额,不是可发现性。 该研究的实验管线是:先由 Google 搜索检索出前 5 个来源,再由模型综合生成带引文的答案。也就是说,内容能否进入候选集是给定的前提,优化只作用于「进入候选集之后是否被引用」。这与第 3.1 节那篇综述的结论并不冲突 —— 二者测的是漏斗的不同段。
- 模型是 GPT-3.5 时代的。 该研究的生成环节使用 GPT-3.5-turbo。截至本报告撰写时,我们未找到在 2026 年主流模型上对其主要效应的独立复现。这是本报告最重要的一个已知缺口。
- **「40%」与「37%」是不同口径。** 37% 那个数字来自 Perplexity 上、由大模型评判的「主观印象」评分,样本为 200 例子集;位置加权词数(PAWC)口径下的增益为 9–22%。引用时须指明口径。
3.3 均衡效应:必须成对引用
该研究中最具销售价值的一条是所谓「均衡效应」:原本排名第 5 的站点,通过「引用来源」这一项优化,AI 可见度提升 +115.1%。
这条被广泛引用,但几乎从不与它的另一半同时出现:在同一实验条件下(全部来源均优化),原本排名第 1 的站点下降 30.3%。
本报告规定:+115.1% 永不单独出现。 只讲前一半,是把一个零和再分配描述成了增量创造。诚实的表述是:GEO 在候选集内部重新分配引用份额,它系统性地有利于中后位者、不利于领先者 —— 这对挑战者品牌确实是好消息,但机制是再分配,不是增长。
3.4 关键词堆砌是负收益 —— 这个数字是对的
该论文第 6 节表 5 显示:关键词堆砌在 Perplexity 上的表现比基线低约 10%(PAWC 21.9 对基线 24.1,即 −9.1%)。
撰写本报告过程中,一轮自动化研究曾提出「原论文并无负值,应改为’几乎无提升’」。该修正经复核被驳回 —— 原始表格确实给出负值,提出的「修正」本身是错误的。我们保留这一记录,是因为它例证了本报告卷首的判断:在这个品类里,错误传播的方向是双向的,包括朝着「更保守」的方向传播错误。 逐条回到一手来源是唯一可靠的做法。
3.5 那么什么是有效的
把第 3.1 至 3.4 节的限定叠加起来,剩下的可辩护结论比通常的 GEO 清单短得多,而且重心完全不同:
发现环节与引用环节必须分开处理。 一项针对 ChatGPT 的研究给出了迄今最刺眼的一组对照(A−,预印本):当查询中点名品牌时,模型对其召回率为 99.4%;而在不点名的品类查询中,该品牌被主动发现的比例仅为 3.32%。同一研究中,站内 GEO 评分与被发现率不相关;在 Perplexity 上呈现正相关的是引荐域名数(r = +0.319)与 Reddit 存在度(r = +0.395)。
另一项包含约 25.2 万次试验的研究显示:仅做格式层面的改写,效果基本为零。
三条结论:
- 站内优化决定「被检索到之后是否被引用」,站外资产决定「是否被检索到」。 后者的权重更大,而绝大多数 GEO 服务卖的是前者。
- 纯格式化改造(加小标题、加问答块、加 schema)不足以改变结果。 它是必要卫生,不是杠杆。
- 第三方提及与引荐域名是目前相关性最强的可操作变量。 这把 GEO 的重心从内容生产推向了公关与社区 —— 这也是为什么第七章的九十天序列把「站外权威」排在「站内改造」之前。
本章的诚实结论:GEO 能可靠改变的,是已被检索到的内容是否被引用,以及在候选集中的相对份额。我们尚未能证明它可以稳定改变内容是否被检索到、或产生持久的下游流量 —— 据我们所知,也没有人证明过。因此我们把承诺限制在这个范围内,并用预注册对照来检验每一次具体投入是否奏效。