白皮书 · 第 7 / 13 篇全文在线版
第四章 · 可见度的分布本质:非确定性环境下的测量规范
智能体时代的营销 · Canlah AI · 新加坡 SEO + GEO 机构
✓你正在读的就是完整正文,不是摘要 —— 全书 13 篇全部免费在线公开,无需注册。PDF 只是同一份内容的打印版。
4.1 单次测量无效
AI 答案是随机生成的。同一个提示词问两次,得到的品牌清单可能不同。这一点业内已有共识,但共识止步于此 —— 大多数供应商承认它,然后继续售卖单次测量得出的「排名」。
现有的最好证据来自一项覆盖三个德语区垂类、时间跨度为 2026 年 1 月 24 日至 3 月 20 日的研究(A−,预印本):品牌提及的日间 Jaccard 相似度为 0.45–0.59(消费电子 0.557、体育用品 0.453、电信 0.589);信源层面更不稳定,为 0.34–0.42。
换句话说:今天和明天问同一个问题,大约一半的品牌名单会变,而引用的信源有三分之二会变。
该研究排除了金融与房地产两个垂类,原因是品牌识别率低于 70%。这个排除本身值得注意 —— 它意味着在某些垂类里,连「品牌有没有被提到」都难以稳定判定。
4.2 Canlah 的测量:两个被混为一谈的量
我们在一次客户审计中归档了 503 份完整响应,其中 API 层样本为 OpenAI 240 + Gemini 240(带检索的各 227),覆盖 60 个「引擎 × 层 × 题目」组合,共 3,821 次引用实例、409 个唯一域名。该批数据的采集成本为 86 美元,二次分析零新增成本。
我们本来是想找一个「跑到信源收敛就停」的省钱阈值。结果推翻了这个设计:
| 指标 | 8 轮内的行为 | 需要几轮 |
|---|---|---|
| 品牌提及率 | 非指名层 0/262、指名层 192/192,k = 1 / 2 / 3 / 8 逐层完全相同 | 1 轮(取 2 轮作失败缓冲) |
| 引用信源集合 | 第 8 轮中位组仍在新增 1 个域名,基准覆盖率仅 0.88,仅 36% 的组该轮零新增 | 任何可负担的轮数都买不到 |
停止规则实测(召回率相对该组 8 轮全量并集):固定 2 轮的域名召回中位数仅 50%;要达到 95% 召回需要 5.6 轮,比现行的 8 轮只省 30%。没有任何阈值能同时做到省钱和保真。
由此得出本报告的核心方法论主张:
行业把两个性质完全不同的量混成了一个分数。 「我被提到了吗」便宜且立即稳定;「谁被引用了」昂贵且永不收敛。 任何售卖单一 AI 可见度分数的产品,都在拿一个已收敛的量,去平均一个从未收敛的量。
这条主张对采购方有直接的价值:品牌提及率可以低成本、高频率地测量(1–2 轮即可),因此值得作为持续监控指标;而「谁在被引用」的完整图景无法在合理预算内穷举,任何声称给出完整引用榜单的产品,都在报告一个截断的样本,并且通常不披露截断在哪里。
4.3 这条主张的局限(必须与结论同时出现)
支撑「1 轮足够」的两个数字 —— 0/262 与 192/192 —— 是两个饱和端点。该品牌在不点名的品类查询中完全隐形,在点名查询中必然被提及。在端点上,「多测几轮结果不变」接近于平凡结论。
评分模型真正要服务的是中间态品牌(提及率约 30–60%),而这批数据里一个中间态样本都没有。 在补齐中间态标定之前,「1 轮足够」只对饱和情形成立,不可外推。
我们把这条局限写进正文,而不是附录,因为把结论外推到未测量的区间,正是本报告通篇在批评的行为。
我们怎么控制它: 在补齐中间态标定之前,对提及率处于中间区间的品牌,我们按二项分布计算所需样本量并据此定轮数,而不是套用「1 轮足够」;每份报告里的提及率都带区间,不给点值。换句话说,这条局限的代价由我们承担为更高的采样成本,不转嫁为客户报告里的虚假精度。
4.4 跨层分歧:比跨日波动更大的一个量
在另一次审计中(n = 12 题),我们把同一批查询同时投给 API 层与浏览器层,比较两层各自引用的信源集合:
Jaccard 均值 0.103(中位 0.105 · 标准差 0.046 · 范围 0.028–0.170 · 95% 置信区间 [0.074, 0.132])。
两层读的几乎是完全不同的文档。
这批数据还提供了一个自我拆穿的范例。表面上,两层的「品牌命中一致率」是 83.3%,看起来不错。但拆层之后:8 道「两层都说没命中」的空题一致率 100%(不提供任何信息),4 道真正有信号的题一致率 50% —— 等于抛硬币。83.3% 是被空题稀释出来的。
两个量必须分清,不可放在同一根轴上比较:
| 测的是什么 | 数值 | |
|---|---|---|
| 德语区研究(A−) | 同一层内、跨日的稳定性 | 品牌 0.45–0.59;信源 0.34–0.42 |
| Canlah(一手) | 跨层(API vs 浏览器)、同日 | 信源 0.103 |
正确的合并表述是:跨层分歧的幅度约为跨日波动的三倍。 不可表述为「Canlah 测得的一致率低于学术研究」—— 那是把两个不同的量当成同一个量比较。
实务含义: 交付给客户的「AI 里怎么说我们」的断言,头牌证据必须是浏览器可复现的界面截屏。API 适用于规模、趋势与相对份额;凡客户能在自己浏览器里一句话证伪的断言,必须过浏览器这一关。我们在一个真实案例中观察到(第三章的走读):同一品牌、同一条 grounded API 通道、3 个日期,稳定输出错误答案(称其未开业),而浏览器层同期输出正确答案;另一条 API 通道没有犯这个错 —— 这正是「哪个模型、哪一层、哪种问法」每次都必须说清的原因。
4.5 提议的测量规范
基于以上,本报告提出四条最低标准,并公开承诺 Canlah 的交付遵守它:
- 提示词面板预注册。 测量开始前公布提示词全集与生成规则。业内通行做法是由已知答案的人编写面板,这在方法论上等价于自己给自己出考题。
- 提及率与信源集合分别定 n,并分别报告。 不合成单一分数。
- 报告方差,不只报告点值。 每个指标给出重复测量的区间。
- 头牌证据为浏览器级,带时间戳截屏与完整信源列表;API 结果单独标注为「API 层参考」。
这四条都不需要专有技术,任何同行都可以采用。我们公开它,是因为在一个测量不可靠的品类里,可复核性本身就是唯一可辩护的差异化。
4.6 一份真实的预注册提示词面板(新加坡奥数培训垂类)
上面四条标准里,第一条最容易被口头承诺、最难被检验。所以我们把一份真实审计用过的面板原样放在这里:一份报告日期为 2026 年 7 月 29 日的 DeepAudit 交付件(打码样本于 8 月 1 日归档),客户是新加坡一家奥数培训中心(客户名、域名与地址已打码为 ▓▓▓▓▓▓,竞品以「竞品A▓」等代号替换)。这次探测共 36 条提示词、6 层、每层 6 条,OpenAI 与 Gemini 各采样 2 轮,合计 144 次(成功 142、失败 2,失败样本同样归档)。下表列出其中 24 条:交付件附件 B 节选的前 20 条一条不删、原样照录,加上附件 C 公证样本里的 4 条指名层查询,每层至少两条。探测语言为英文,原句照录。以下全部数字为 Canlah 一手;漏斗提及率均为 API 层采样口径、未经浏览器复现,按 4.5 第四条只作「API 层参考」。
生成规则(与 4.5 第一条对齐,四问四答)
- 谁写? 不是客户,也不是知道答案的分析师。层结构与提示词措辞由一个模型(Gemini)根据客户业务画像、垂类骨架和一份合成规则表生成;代码对输出做硬校验(受监管垂类必须有资质核验层;有实体门店必须有地缘层,纯线上不得有;品牌层与竞品层永不删除;禁用模板过滤;占位符语法),不合规的被剪掉,剪不干净就整体回退到静态模板,回退会记录在案。36 条里 12 条(33%)改写自真实用户搜索数据(Google 自动补全 11 条、Google 追问 1 条),逐条附原句与来源链接;其余 24 条按买家旅程分层合成 —— 交付件表格里把这 24 条一律标为「模板合成」,因为渲染层只区分「改写自真实查询」与「其他」,不区分模型合成与静态模板。这份交付件标注「漏斗结构由业务画像定制合成」;本文没有逐项打开它的合成记录复核回退标记,这一点未核实。
- 写之前知不知道答案?
不知道。面板在探测开始前生成,连同模型名、prompt
哈希、原始响应一起归档到交付件的
_source/funnel_synthesis/;自动补全与追问来自 Google,它们不知道哪家会被 AI 点名。一项第三方方法论批评(B)指出,行业通行的面板由事先知道被测品牌的人编写,结论在测量开始前就已嵌进去了 —— 这条规则就是针对它。 - 不含品牌名的比例? 按层结构,36 条里 24 条(67%)不含任何品牌名(S1–S4);12 条含本品牌名或竞品名(S5–S6)。只有前者计入可见度成绩。指名层里 AI 复述问句就算「提及」,是同义反复,权重为零、只作参考。这个 24 是按「每层 6 条 × 4 层」算的;下表能看到的 20 条 S1–S4 提示词确实都不含品牌名,看不到的 4 条(S4 后 4 条)未核实。
- 市场怎么分离? 这份面板当时过了两道关:全部查询在 gl=sg 上下文里执行;候选入池前拒收带美国锚(「USA / United States」)的候选 —— 这条规则 7 月 25 日写进代码,早于本次探测。当时没有的是更严的一道。8 月 7 日记录的一次事故:某诊所客户的 gl=sg 候选池里混进了一家英国小镇的同名诊所,以及「…… london」「…… meaning in urdu」之类的候选 —— Google 自动补全按种子词补全,gl 只影响排序,不排除外国实体。那次事故之后,代码加了一道确定性的地理/语言闸门:带外国市场地名(伦敦、悉尼、吉隆坡……)、语言名或非目标文字的候选一律拒收,只放行被审市场自己的地名(「Singapore」与区名),拒收数计入并披露,不静默丢弃。这道闸门不曾追溯应用到这份 7 月 29 日的面板;从下表看,这份面板没有混入外国实体,但那是运气,不是闸门。
| # | 层 | 意图类型 | 提示词(英文原句) | 来源(交付件原标) |
|---|---|---|---|---|
| 1 | S1 品类觉知 | 品类 · 推荐 | Which center offers the best math olympiad training in Singapore? | 自动补全:best math olympiad training singapore |
| 2 | S1 | 品类 · 推荐 | What are the top options for math olympiad training in Singapore? | 自动补全:math olympiad training singapore |
| 3 | S1 | 品类 · 推荐 | What is the best math olympiad training center in Singapore for… | 追问(PAA):What is the best tuition in Singapore? |
| 4 | S1 | 品类 · 问题式 | Is math olympiad training worth it for primary school students in… | 自动补全:is math olympiad worth it |
| 5 | S1 | 品类 · 问题式 | How to choose a reliable math olympiad training program in Singapore? | 自动补全:how to train for math olympiad |
| 6 | S1 | 品类 · 推荐 | What are the most recommended math olympiad training classes in… | 自动补全:math olympiad training for kids |
| 7 | S2 合规资质核验 | 问题式 · 信任核验 | How to check if a math olympiad training center is MOE-registered in Singapore? | 模板合成 |
| 8 | S2 | 问题式 · 信任核验 | Are all math olympiad training providers in Singapore legally registered with the Ministry of Education? | 模板合成 |
| 9 | S2 | 问题式 · 信任核验 | How to verify the official qualifications of math olympiad training… | 模板合成 |
| 10 | S2 | 问题式 · 信任核验 | What safety and educational standards must tuition centers offering… | 模板合成 |
| 11 | S2 | 问题式 · 信任核验 | Where can I find the official list of registered math olympiad… | 模板合成 |
| 12 | S2 | 问题式 · 信任核验 | How to avoid unaccredited education agencies when booking math… | 模板合成 |
| 13 | S3 地缘区域探索 | 本地 | Where can I find top-rated math olympiad training near ▓▓▓▓▓▓? | 自动补全:math olympiad training near me |
| 14 | S3 | 本地 | Are there any reputable math olympiad training classes in ▓▓▓▓▓▓, Singapore? | 自动补全:math olympiad classes near me |
| 15 | S3 | 本地 | Which math olympiad training center near ▓▓▓▓▓▓ has the most… | 自动补全:mathematical olympiad training center near me |
| 16 | S3 | 本地 | Looking for high-scoring math olympiad training preparation near… | 自动补全:math olympiad preparation near me |
| 17 | S3 | 本地 | What are the best math competition training options near ▓▓▓▓▓▓? | 自动补全:math competition classes near me |
| 18 | S3 | 本地 | Best physical tuition centers for math olympiad training around… | 自动补全:maths olympiad classes near me for kids |
| 19 | S4 竞赛战绩证明 | 问题式 · 证据 | Which math olympiad training center in Singapore has the highest SASMO or NMOS medal win rate? | 模板合成 |
| 20 | S4 | 问题式 · 证据 | What are the proven competition results of math olympiad training students in Singapore? | 模板合成 |
| 21 | S5 品牌名直问 | 品牌直问 | Is ▓▓▓▓▓▓ worth it for high-level math competition prep? | 附件 C 公证样本(来源未列) |
| 22 | S5 | 品牌直问 | What do parents say about the teaching quality at ▓▓▓▓▓▓? | 附件 C 公证样本(来源未列) |
| 23 | S6 竞品名对照 | 比较 | 竞品C▓ vs ▓▓▓▓▓▓ — which center is better for Olympiad math? | 附件 C 公证样本(来源未列) |
| 24 | S6 | 比较 | Should I switch my child from 竞品A▓ to ▓▓▓▓▓▓ for advanced training? | 附件 C 公证样本(来源未列) |
「…」是交付件表格的原样截断,全句在交付件 raw/ 归档里;我们不在这里补全。#7、#8、#14、#19、#20 的全句取自附件 C 的公证样本,其余照附件 B 原样。#3 的原句是「What is the best tuition in Singapore?」,由一条更宽的品类问题改写而来 —— 我们照录,不替它辩护。这 24 条里 20 条不含品牌名;「near ▓▓▓▓▓▓」处遮蔽的是地址,按打码规则不是品牌名。
为什么这样分层
- 层是买家旅程的阶段,不是关键词类型。 同一管线给不同客户合成出不同的层:这份面板有「合规资质核验」和「竞赛战绩证明」两层,因为教育办学在新加坡带受监管信号、奥数家长看奖牌;同一天(7 月 29 日)我们用同一管线自审 canlah.ai,得到的是 5 层(品类与认知定义 / 与传统替代方案比较 / 本地服务商筛选 / 品牌直问 / 竞品对照),没有资质层,也没有战绩层。层数下限 4、上限 7,写在代码里(下限 4 于 7 月 25 日定下,早于这两次探测)。
- 分层才能定位「隐形在哪一层」,而不是给一个总分。 这份面板的实测(API 层采样):S2 与 S4 两层在两个引擎上提及率区间上限都是 0%(OpenAI 0/9、0/12;Gemini 0/11、0/10);S3 层 OpenAI 12/12、Gemini 0/12 —— 同一层、同一批提示词,两个引擎给出完全相反的答案。这就是第四章反复讲的「可见度是分布、不是点值」落在一个客户身上的样子;一个综合分会把它平均掉。(注意:这是两个引擎之间的分歧,与 4.4 的 API 层 vs 浏览器层分歧是两个不同的量,不可混用。)
- 指名层留着但不计分,用途是锚定。 它确认引擎认得这个品牌实体,并给竞品对照一个基线;它的提及率写在报告里,标注「不计入可见度成绩、也不参与评分」。
这份面板还没做到的
- 它是「先生成、后探测、随交付件披露」,不是 4.5 意义上的「测量前公开」。公开发生在报告交付时,客户此前看不到面板。严格的预注册需要在探测前把面板与 prompt 哈希交给客户或第三方;我们还没有这么做,这是差距,不是措辞问题。
- 交付件同时披露了另一份 12 条「买家提示词候选池」(按发现 / 对比 / 推荐 / 事实四类意图),本次 0/12 实测 —— 它是选题清单,不是探测面板,报告里分开标了,读者不要把两份数字混起来。
- 24 条是 36 条的子集。附件 B 只节选前 20 条(S1–S4 的 24 条里少 4 条 S4),S5/S6 共 12 条里只有公证样本里的 4 条能在打码交付件里核对,所以表里 #21–24 的来源栏写「未列」—— 它们是真实改写还是合成,在打码件里查不到,我们不猜。
- 交付件内部对「非指名」的口径不统一:漏斗模块按层把 S5/S6 排除在成绩之外,而「默认赢家」模块写「非指名 query 共 36 条」、汇总行写「非指名层提及率 31/133」(133 是六层分母之和)。本文只采用漏斗模块的分层数字,不引用后两处。