白皮书 · 第 7 / 13 篇全文在线版

第四章 · 可见度的分布本质:非确定性环境下的测量规范

智能体时代的营销 · Canlah AI · 新加坡 SEO + GEO 机构

约 10 分钟读完 · 2026-08

你正在读的就是完整正文,不是摘要 —— 全书 13 篇全部免费在线公开,无需注册。PDF 只是同一份内容的打印版。

0.103API 层与浏览器层引用信源的 Jaccard 重合度
0.45–0.59同一层内跨日的品牌清单相似度
503一次客户审计归档的完整回答数

4.1 单次测量无效

AI 答案是随机生成的。同一个提示词问两次,得到的品牌清单可能不同。这一点业内已有共识,但共识止步于此 —— 大多数供应商承认它,然后继续售卖单次测量得出的「排名」。

现有的最好证据来自一项覆盖三个德语区垂类、时间跨度为 2026 年 1 月 24 日至 3 月 20 日的研究(A−,预印本):品牌提及的日间 Jaccard 相似度为 0.45–0.59(消费电子 0.557、体育用品 0.453、电信 0.589);信源层面更不稳定,为 0.34–0.42

换句话说:今天和明天问同一个问题,大约一半的品牌名单会变,而引用的信源有三分之二会变

该研究排除了金融与房地产两个垂类,原因是品牌识别率低于 70%。这个排除本身值得注意 —— 它意味着在某些垂类里,连「品牌有没有被提到」都难以稳定判定。

同一个问题,今天和明天:大约一半的品牌名单会变(日间 Jaccard 相似度)
单次测量拿到的「排名」,第二天大约一半的品牌名单就已经变了;信源层面更不稳定,引用的信源有三分之二会变。该研究排除了品牌识别率低于 70% 的金融与房地产两个垂类。

4.2 Canlah 的测量:两个被混为一谈的量

我们在一次客户审计中归档了 503 份完整响应,其中 API 层样本为 OpenAI 240 + Gemini 240(带检索的各 227),覆盖 60 个「引擎 × 层 × 题目」组合,共 3,821 次引用实例、409 个唯一域名。该批数据的采集成本为 86 美元,二次分析零新增成本。

我们本来是想找一个「跑到信源收敛就停」的省钱阈值。结果推翻了这个设计:

指标 8 轮内的行为 需要几轮
品牌提及率 非指名层 0/262、指名层 192/192,k = 1 / 2 / 3 / 8 逐层完全相同 1 轮(取 2 轮作失败缓冲)
引用信源集合 第 8 轮中位组仍在新增 1 个域名,基准覆盖率仅 0.88,仅 36% 的组该轮零新增 任何可负担的轮数都买不到

停止规则实测(召回率相对该组 8 轮全量并集):固定 2 轮的域名召回中位数仅 50%;要达到 95% 召回需要 5.6 轮,比现行的 8 轮只省 30%。没有任何阈值能同时做到省钱和保真。

由此得出本报告的核心方法论主张:

行业把两个性质完全不同的量混成了一个分数。 「我被提到了吗」便宜且立即稳定;「谁被引用了」昂贵且永不收敛。 任何售卖单一 AI 可见度分数的产品,都在拿一个已收敛的量,去平均一个从未收敛的量。

这条主张对采购方有直接的价值:品牌提及率可以低成本、高频率地测量(1–2 轮即可),因此值得作为持续监控指标;而「谁在被引用」的完整图景无法在合理预算内穷举,任何声称给出完整引用榜单的产品,都在报告一个截断的样本,并且通常不披露截断在哪里。

被混成一个分数的两个量:一个 1 轮就稳,一个 8 轮不收敛
「我被提到了吗」便宜且立即稳定;「谁被引用了」昂贵且永不收敛。任何售卖单一 AI 可见度分数的产品,都在拿一个已收敛的量,去平均一个从未收敛的量。局限(4.3):0/262 与 192/192 是两个饱和端点;中间态品牌(提及率约 30–60%)在这批数据里一个样本都没有,「1 轮足够」只对饱和情形成立,不可外推。

4.3 这条主张的局限(必须与结论同时出现)

支撑「1 轮足够」的两个数字 —— 0/262 与 192/192 —— 是两个饱和端点。该品牌在不点名的品类查询中完全隐形,在点名查询中必然被提及。在端点上,「多测几轮结果不变」接近于平凡结论。

评分模型真正要服务的是中间态品牌(提及率约 30–60%),而这批数据里一个中间态样本都没有。 在补齐中间态标定之前,「1 轮足够」只对饱和情形成立,不可外推。

我们把这条局限写进正文,而不是附录,因为把结论外推到未测量的区间,正是本报告通篇在批评的行为。

我们怎么控制它: 在补齐中间态标定之前,对提及率处于中间区间的品牌,我们按二项分布计算所需样本量并据此定轮数,而不是套用「1 轮足够」;每份报告里的提及率都带区间,不给点值。换句话说,这条局限的代价由我们承担为更高的采样成本,不转嫁为客户报告里的虚假精度。

4.4 跨层分歧:比跨日波动更大的一个量

在另一次审计中(n = 12 题),我们把同一批查询同时投给 API 层与浏览器层,比较两层各自引用的信源集合:

Jaccard 均值 0.103(中位 0.105 · 标准差 0.046 · 范围 0.028–0.170 · 95% 置信区间 [0.074, 0.132])。

两层读的几乎是完全不同的文档。

这批数据还提供了一个自我拆穿的范例。表面上,两层的「品牌命中一致率」是 83.3%,看起来不错。但拆层之后:8 道「两层都说没命中」的空题一致率 100%(不提供任何信息),4 道真正有信号的题一致率 50% —— 等于抛硬币。83.3% 是被空题稀释出来的。

两个量必须分清,不可放在同一根轴上比较:

测的是什么 数值
德语区研究(A−) 同一层内、跨日的稳定性 品牌 0.45–0.59;信源 0.34–0.42
Canlah(一手) 跨层(API vs 浏览器)、同日 信源 0.103

正确的合并表述是:跨层分歧的幅度约为跨日波动的三倍。 不可表述为「Canlah 测得的一致率低于学术研究」—— 那是把两个不同的量当成同一个量比较。

实务含义: 交付给客户的「AI 里怎么说我们」的断言,头牌证据必须是浏览器可复现的界面截屏。API 适用于规模、趋势与相对份额;凡客户能在自己浏览器里一句话证伪的断言,必须过浏览器这一关。我们在一个真实案例中观察到(第三章的走读):同一品牌、同一条 grounded API 通道、3 个日期,稳定输出错误答案(称其未开业),而浏览器层同期输出正确答案;另一条 API 通道没有犯这个错 —— 这正是「哪个模型、哪一层、哪种问法」每次都必须说清的原因。

83.3% 的一致率是怎么被空题稀释出来的
API 层 vs 浏览器层「品牌命中一致率」,n = 12 题:一个看起来不错的汇总数字,拆层后只剩抛硬币。同批数据两层引用信源集合的 Jaccard 均值 0.103(中位 0.105 · 标准差 0.046 · 范围 0.028–0.170 · 95% 置信区间 [0.074, 0.132])——两层读的几乎是完全不同的文档;它与图 1 的跨日 0.45–0.59 是不同的量,不可放在同一根轴上比较。交付给客户的断言,头牌证据必须是浏览器可复现的界面截屏。

4.5 提议的测量规范

基于以上,本报告提出四条最低标准,并公开承诺 Canlah 的交付遵守它:

  1. 提示词面板预注册。 测量开始前公布提示词全集与生成规则。业内通行做法是由已知答案的人编写面板,这在方法论上等价于自己给自己出考题。
  2. 提及率与信源集合分别定 n,并分别报告。 不合成单一分数。
  3. 报告方差,不只报告点值。 每个指标给出重复测量的区间。
  4. 头牌证据为浏览器级,带时间戳截屏与完整信源列表;API 结果单独标注为「API 层参考」。

这四条都不需要专有技术,任何同行都可以采用。我们公开它,是因为在一个测量不可靠的品类里,可复核性本身就是唯一可辩护的差异化

4.6 一份真实的预注册提示词面板(新加坡奥数培训垂类)

上面四条标准里,第一条最容易被口头承诺、最难被检验。所以我们把一份真实审计用过的面板原样放在这里:一份报告日期为 2026 年 7 月 29 日的 DeepAudit 交付件(打码样本于 8 月 1 日归档),客户是新加坡一家奥数培训中心(客户名、域名与地址已打码为 ▓▓▓▓▓▓,竞品以「竞品A▓」等代号替换)。这次探测共 36 条提示词、6 层、每层 6 条,OpenAI 与 Gemini 各采样 2 轮,合计 144 次(成功 142、失败 2,失败样本同样归档)。下表列出其中 24 条:交付件附件 B 节选的前 20 条一条不删、原样照录,加上附件 C 公证样本里的 4 条指名层查询,每层至少两条。探测语言为英文,原句照录。以下全部数字为 Canlah 一手;漏斗提及率均为 API 层采样口径、未经浏览器复现,按 4.5 第四条只作「API 层参考」。

生成规则(与 4.5 第一条对齐,四问四答)

  1. 谁写? 不是客户,也不是知道答案的分析师。层结构与提示词措辞由一个模型(Gemini)根据客户业务画像、垂类骨架和一份合成规则表生成;代码对输出做硬校验(受监管垂类必须有资质核验层;有实体门店必须有地缘层,纯线上不得有;品牌层与竞品层永不删除;禁用模板过滤;占位符语法),不合规的被剪掉,剪不干净就整体回退到静态模板,回退会记录在案。36 条里 12 条(33%)改写自真实用户搜索数据(Google 自动补全 11 条、Google 追问 1 条),逐条附原句与来源链接;其余 24 条按买家旅程分层合成 —— 交付件表格里把这 24 条一律标为「模板合成」,因为渲染层只区分「改写自真实查询」与「其他」,不区分模型合成与静态模板。这份交付件标注「漏斗结构由业务画像定制合成」;本文没有逐项打开它的合成记录复核回退标记,这一点未核实。
  2. 写之前知不知道答案? 不知道。面板在探测开始前生成,连同模型名、prompt 哈希、原始响应一起归档到交付件的 _source/funnel_synthesis/;自动补全与追问来自 Google,它们不知道哪家会被 AI 点名。一项第三方方法论批评(B)指出,行业通行的面板由事先知道被测品牌的人编写,结论在测量开始前就已嵌进去了 —— 这条规则就是针对它。
  3. 不含品牌名的比例? 按层结构,36 条里 24 条(67%)不含任何品牌名(S1–S4);12 条含本品牌名或竞品名(S5–S6)。只有前者计入可见度成绩。指名层里 AI 复述问句就算「提及」,是同义反复,权重为零、只作参考。这个 24 是按「每层 6 条 × 4 层」算的;下表能看到的 20 条 S1–S4 提示词确实都不含品牌名,看不到的 4 条(S4 后 4 条)未核实。
  4. 市场怎么分离? 这份面板当时过了两道关:全部查询在 gl=sg 上下文里执行;候选入池前拒收带美国锚(「USA / United States」)的候选 —— 这条规则 7 月 25 日写进代码,早于本次探测。当时没有的是更严的一道。8 月 7 日记录的一次事故:某诊所客户的 gl=sg 候选池里混进了一家英国小镇的同名诊所,以及「…… london」「…… meaning in urdu」之类的候选 —— Google 自动补全按种子词补全,gl 只影响排序,不排除外国实体。那次事故之后,代码加了一道确定性的地理/语言闸门:带外国市场地名(伦敦、悉尼、吉隆坡……)、语言名或非目标文字的候选一律拒收,只放行被审市场自己的地名(「Singapore」与区名),拒收数计入并披露,不静默丢弃。这道闸门不曾追溯应用到这份 7 月 29 日的面板;从下表看,这份面板没有混入外国实体,但那是运气,不是闸门。
# 意图类型 提示词(英文原句) 来源(交付件原标)
1 S1 品类觉知 品类 · 推荐 Which center offers the best math olympiad training in Singapore? 自动补全:best math olympiad training singapore
2 S1 品类 · 推荐 What are the top options for math olympiad training in Singapore? 自动补全:math olympiad training singapore
3 S1 品类 · 推荐 What is the best math olympiad training center in Singapore for… 追问(PAA):What is the best tuition in Singapore?
4 S1 品类 · 问题式 Is math olympiad training worth it for primary school students in… 自动补全:is math olympiad worth it
5 S1 品类 · 问题式 How to choose a reliable math olympiad training program in Singapore? 自动补全:how to train for math olympiad
6 S1 品类 · 推荐 What are the most recommended math olympiad training classes in… 自动补全:math olympiad training for kids
7 S2 合规资质核验 问题式 · 信任核验 How to check if a math olympiad training center is MOE-registered in Singapore? 模板合成
8 S2 问题式 · 信任核验 Are all math olympiad training providers in Singapore legally registered with the Ministry of Education? 模板合成
9 S2 问题式 · 信任核验 How to verify the official qualifications of math olympiad training… 模板合成
10 S2 问题式 · 信任核验 What safety and educational standards must tuition centers offering… 模板合成
11 S2 问题式 · 信任核验 Where can I find the official list of registered math olympiad… 模板合成
12 S2 问题式 · 信任核验 How to avoid unaccredited education agencies when booking math… 模板合成
13 S3 地缘区域探索 本地 Where can I find top-rated math olympiad training near ▓▓▓▓▓▓? 自动补全:math olympiad training near me
14 S3 本地 Are there any reputable math olympiad training classes in ▓▓▓▓▓▓, Singapore? 自动补全:math olympiad classes near me
15 S3 本地 Which math olympiad training center near ▓▓▓▓▓▓ has the most… 自动补全:mathematical olympiad training center near me
16 S3 本地 Looking for high-scoring math olympiad training preparation near… 自动补全:math olympiad preparation near me
17 S3 本地 What are the best math competition training options near ▓▓▓▓▓▓? 自动补全:math competition classes near me
18 S3 本地 Best physical tuition centers for math olympiad training around… 自动补全:maths olympiad classes near me for kids
19 S4 竞赛战绩证明 问题式 · 证据 Which math olympiad training center in Singapore has the highest SASMO or NMOS medal win rate? 模板合成
20 S4 问题式 · 证据 What are the proven competition results of math olympiad training students in Singapore? 模板合成
21 S5 品牌名直问 品牌直问 Is ▓▓▓▓▓▓ worth it for high-level math competition prep? 附件 C 公证样本(来源未列)
22 S5 品牌直问 What do parents say about the teaching quality at ▓▓▓▓▓▓? 附件 C 公证样本(来源未列)
23 S6 竞品名对照 比较 竞品C▓ vs ▓▓▓▓▓▓ — which center is better for Olympiad math? 附件 C 公证样本(来源未列)
24 S6 比较 Should I switch my child from 竞品A▓ to ▓▓▓▓▓▓ for advanced training? 附件 C 公证样本(来源未列)

「…」是交付件表格的原样截断,全句在交付件 raw/ 归档里;我们不在这里补全。#7、#8、#14、#19、#20 的全句取自附件 C 的公证样本,其余照附件 B 原样。#3 的原句是「What is the best tuition in Singapore?」,由一条更宽的品类问题改写而来 —— 我们照录,不替它辩护。这 24 条里 20 条不含品牌名;「near ▓▓▓▓▓▓」处遮蔽的是地址,按打码规则不是品牌名。

为什么这样分层

这份面板还没做到的


本报告全文免费公开。如需 PDF 版本(便于转发与归档),到白皮书主页留邮箱获取 →