Canlah Research · 开源案例研究 · CC BY 4.0
一问七引擎:每个 AI 搜索引擎到底在引用什么
把「新加坡最好的 GEO 公司」这一个问题(中英双语),同一晚问 7 个搜索/AI 答案引擎,抓回它们引用的每一个网页,逐页分类,再对照各引擎的公开文档逆推「它为什么引这些页」。
探测 2026-08-29 · v1.0 发布 2026-08-30 · v1.1(登出态 ChatGPT 复测)2026-08-31 · 新加坡出口
四个数字
-
0
被 5 个或更多引擎同时引用的网页数(最高只有 4 个引擎)
-
0.171 / 0.091
前十结果域名重合度均值(Jaccard,中文 / 英文)
-
116
引用记录(80 个原始 URL,规范化后 71 个唯一页面,全部尝试抓取并存证)
-
53 / 3 / 0
56 条引擎机制文档声明经对抗核查:确认 / 软化保留 / 推翻
七个引擎,七种信源口味
本轮观测到的主导信源形态,和「想被它引用,先测什么」的工作假设(是假设,不是结论 —— 边界见下)。
| 引擎 | 本轮主导信源 | 优先测试的假设 |
|---|---|---|
| Google 自然搜索 | 厂商服务页(13/18) | 精确匹配、本地锚定的服务页可能是主入场资产 |
| Google AI Mode | 服务页 + 商家实体/Places 资料 | 实体层(商家档案、评分、本地性)可能比页面形态更重要 |
| Gemini + 搜索 grounding(API) | 地理测绘/GIS 页面(16/16,题目被读歪) | 先消除词义歧义,可能是入场的前提条件 |
| OpenAI web_search(API) | 现成的「Best X」榜单页(6/9) | 带方法论的自建排名榜可能是这个面的最高杠杆资产 |
| ChatGPT 消费者端(登录) | 6 个厂商域名的纵深引用(17 条引用) | 内部自洽的多页内容簇可能胜过单个优化页面 |
| Exa(神经检索 API) | 厂商能力页(18/20) | 用完整句子描述服务本身的页面,可能是向量检索的优化单元 |
| Tavily(RAG 检索 API) | 最宽的混合(目录/媒体/社交都收) | 第三方存在的广度可能比任何单一自有资产更重要 |
本轮发现
- 信源不共享:71 个唯一页面里,没有一个被 5 个或更多引擎引用;引用最广的三个页面也只到 4 个引擎。
- 信源发散、品牌收敛:各引擎引的网页几乎不同,点名的厂商却大量重合。一个与数据一致的假设:跨引擎存在感来自「很多发布者反复提到同一实体」的二级传播网络,而不是某一个排名很高的页面。
- 自建「Best X」榜单只在三个面被采纳:OpenAI web_search(3/9)、ChatGPT 消费者端(6/17)、Google 自然结果(4/18,能进前十、拿不到第 1);Exa、Tavily、AI Mode、Gemini 本轮零采纳。且没有任何引擎过滤利益冲突 —— 每份自建榜单都把发布者自己排第一,照样被引用。
- 结构化数据相关、但不保证:ChatGPT 被引页 17/17、Google 被引记录 16/18 带 JSON-LD;但 AI Mode 和 Gemini 也引了无 schema 页、被反爬墙挡住的页、甚至一个 404。
- 词义消歧是一票否决项:Gemini 双语都把 GEO 读成地理测绘(16/16),其中不乏探测前几天刚更新的新页 —— 新鲜度救不回词义错位。
v1.1 复测:登出态的 ChatGPT 是另一个引擎
两天后我们在无痕窗口(无账号、开网页搜索)重跑同样两问,得到 3 轮中文、5 轮英文回答。登出态每轮都先弹出地图和 11–15 张商家评分卡片(登录态没有这一层,且 8 轮里 4 轮的卡片混入了岩土/测绘公司 —— Gemini 那个词义泄漏出现在了 ChatGPT 的实体层);文字推荐名单跨轮品牌重合度英文 0.70、中文 0.54,比引用网页稳定得多。测「ChatGPT 可见度」必须声明测的是登录面还是登出面。
边界 —— 引用任何数字前先读这段
- n = 1 个问题 × 1 晚 × 1 个地区 × 2 种语言。这是带可复跑方法的法医式案例研究,不是统计调查;AI 答案本身逐次波动,每个数字都是一次快照。
- 传统引擎给的是结果列表,答案引擎给的是引用列表 —— 相关但不完全等价的比较单位。
- 文档层机制与本轮输出的吻合,只陈述为「一致」,不陈述为因果。
- 登录态 ChatGPT 探测未排除账号个性化;v1.1 的登出复测部分退役了这条(英文侧),但复测自身是同一会话内重复提交,后轮看得到前轮。
利益披露
Canlah Research 是新加坡 GEO 服务商 Canlah AI Pte. Ltd. 的研究线 —— 我们是这项研究所测量市场的参与者。本轮里,「Canlah AI」被 2 个引擎的答案点名、canlah.ai 被 1 个引擎引用(即带个性化警告的那次登录态探测;v1.1 登出复测英文 3/5 轮、中文 0/3 轮),其余引擎均未出现。我们把没被引用的部分和分类器的一个已修复 bug 一并公开 —— 全部标签、矩阵与核查判定都在数据仓里,每个派生统计都可以不信任我们地重新算出来。
拿去复跑
方法对任何行业成立:选一个你的买家真会问的问题,问遍他们真在用的每个引擎,同一晚抓回全部被引页面,用仓库里的冻结分类代码本逐页分类,然后看每个引擎奖励了什么形态的页面。探测口径(method/probes.md)和分类代码(scripts/classify.py)都在仓库里。
引用格式
Canlah Research (2026). Same Question, Seven Engines: What Each AI Search Engine Cited — and Working Hypotheses for Targeting Each. https://canlah.ai/lab/seven-engines/