Skip to main content
观点 2026-09-23 更新于 2026-09-23 · 10 分钟阅读

AI 可见度市场的测量问题 —— 以及没人提的采样深度缺口

AI 可见度工具卖的那个分数,背后是每个问句每天一条回答。提及率需要区间,被引信源集合则需要深得多的采样。

层层向后退去的深色卡片,其中一条边亮起靛蓝色

AI 可见度市场有一个测量问题:在 2026 年 9 月 23 日审阅的四份工具套餐里,对外的那个分数背后是「每个问句、每个引擎、每天一条回答」。而这条回答本身并不稳定。同一个问句发给同一个引擎两次,可能返回不同的品牌名单、不同的排序和不同的被引页面。SparkToro 与 Gumshoe 在 2026 年 1 月 27 日发表的研究给出了这个问题的量级;Canlah AI 的审计归档则说明重复采样能修好什么、修不好什么。

更尖锐的问题是采样深度:在报出一个比率之前,按问题、按引擎、按层各采集了多少条回答。公开的工具套餐把覆盖面描述成「问句数 × 引擎数 × 天数」,却很少说清一天的那个数字背后站着多少条回答。品牌提及率和被引信源集合在重复采样下的行为并不一样,把两者揉进一个分数,就掩盖了哪一部分是测出来的、哪一部分是估出来的。可见度分数是分布里的一次抽样,不是分布本身。

核心结论

  • 名单本身不稳定: 在 SparkToro 2026 年 1 月 27 日的研究中,600 名志愿者把 12 个问句跑了 2,961 次;任意两条回答返回同一份品牌名单的概率不到百分之一。
  • 两种量,一个分数: 品牌有没有被提及,在重复采样下很快收敛;被引信源的集合却一直在增长。单一综合分把一个已收敛的量和一个未收敛的量平均在了一起。
  • Canlah AI 自己的缺口: 在一份归档的客户审计中,固定跑两轮只覆盖了八轮所找到被引域名的中位 50%;而 Canlah AI 2026 年 9 月 7 日的自我审计调用的是 Gemini 的浮动别名、没有固定模型,不过每条回答都记录了确切版本号。
  • 一份五层记录: 一个站得住的 AI 可见度数字,需要预注册问题集、写明的采样计划、原始证据、区间,以及一次可比的复测。

SparkToro 的研究测了什么

SparkToro 创始人 Rand Fishkin 与 Gumshoe.ai 的 Patrick O’Donnell 请 600 名志愿者,把 12 个推荐类问句分别跑过 ChatGPT、Claude 和 Google AI Overviews;没有出现 Overview 时改用 Google AI Mode。志愿者共提交了 2,961 条回答,每个问句在每个工具上跑了 60 到 100 次。

研究给出的数字是:ChatGPT 或 Google 的 AI 在 100 条回答中的任意两条里返回同一份品牌名单的概率不到百分之一,返回同一排序的概率约为千分之一。排名位置的表现接近随机。

跨多次运行的出现率仍然有意义:一家数字营销机构在同一个问句的 95 条 Google AI 回答中出现了 85 次。因此计量单位是重复回答中提到该品牌的比例,而不是它在某一条回答里的位置。

信源: SparkToro,AIs are highly inconsistent when recommending brands or products,2026 年 1 月 27 日

这份研究带有厂商关联:共同作者任职于一家 AI 追踪公司,志愿者用的也是美国消费者界面,而不是 API 采集。

为什么单次快照会误导

输出是一场带权重的抽奖

推荐类回答是从一个带权重的候选池里抽出来的。一个真实出现概率为 30% 的品牌,会在多数单条回答里缺席,在一部分回答里出现。一次观测无法把 30% 的品牌与 5% 或 60% 的品牌区分开。

每天一条不等于重复采样

每天收一条、攒够三十条,这三十条回答混合了两种变化来源:一天之内的采样噪声,以及跨天的真实漂移,包括模型更新。

不同界面读的是不同的文档

API 回答和浏览器渲染的回答是两个独立的测量层。一个工具只采样其中一层,却把结果报成「ChatGPT 说了什么」,等于把一个买家在浏览器里无法复现的结论交给了买家。在一份针对 12 个问题的 Canlah AI 审计中,两层引用的信源平均 Jaccard 重合度只有 0.103。

品牌词问题会抬高比率

点名品牌的问题几乎每次都会返回这个品牌。当品牌问题和开放式问题共用一个分母,这个分数测的是认知度,不是被发现。

公开的工具套餐对采样深度披露了什么

在 2026 年 9 月 23 日审阅的四款产品里,公开定价页把深度表述为问句额度、引擎数量和采集频率;单次采集中每题重复几次,审阅页面均未说明。

AI 可见度工具套餐,公开定价页与帮助文档,审阅于 2026 年 9 月 23 日。

服务商 公开的追踪单位 公开方案的可取之处 单次采集中每题重复次数 买家应该核实什么
Peec AI 50、150 或 350 个问句,三个模型,每天采集;回答数 = 问句数 × 模型数 × 天数 把回答数的算术公开写出来,买家签约前就能自己算分母 审阅页面未说明 单个问句、单个模型的当日数字,背后是不是只有一条回答
OtterlyAI 每月 15 个问句 29 美元、100 个 189 美元、400 个 489 美元,每天采集 每一档的问句额度与价格都公开,购买前可以比较每一块钱买到的深度 审阅页面未说明 更大的额度买到的是更多问句,还是同一问句更多次运行
Profound 试用版 50 个问句,覆盖 ChatGPT、Gemini 和 Google AI Overviews,连续七天每天一次 写明了试用覆盖哪些引擎,签约前就知道引擎组合 审阅页面未说明 七天够不够把模型漂移和同一天内的采样噪声分开
Semrush AI Visibility Toolkit 每月 99 美元追踪 25 个问句;分数相对品类中位数计算 给出品牌自身历史之外的对比基准,这是裸比率没有的 审阅页面未说明 品类中位数怎么算出来的,竞品集合变化时它会不会跟着动

信源:服务商定价页与帮助文档,审阅于 2026 年 9 月 23 日。表中的「公开的追踪单位」是公开表述,不是经独立测试的能力。

「审阅页面未说明」指 2026 年 9 月 23 日审阅时,该服务商的公开材料没有描述这一项。它不能证明该服务商内部没有重复问句、没有计算区间。

信源: Peec AI 定价页;OtterlyAI 定价页;Profound 定价页;Semrush AI Visibility Toolkit 帮助文档

Peec AI 的定价页给出了最清楚的算术:50 个问句、三个模型、30 天,得到 4,500 条回答;但摊回这 30 天,单个问句、单个模型的每日数字背后只站着一条回答。四款里只有 Semrush 是拿品类中位数而不是品牌自身历史来打分的,这给了买家一个在自家看板之外的基准。

来自 Canlah AI 的第一方视角

Canlah AI 在 2026 年 9 月 7 日对 canlah.ai 做的自我审计,把 39 个面向新加坡市场的英文买家问题发给两个 API 引擎,每题三次:其中 32 个是开放式问题,7 个点名品牌。计划中的 234 条回答里 233 条成功,216 条带检索信源。在 177 条针对开放式问题、带信源的回答中,Canlah AI 被提及 7 次,提及率 4.0%,95% Wilson 区间为 1.9% 到 7.9%。7 次提及全部来自 ChatGPT,84 条中 7 条,即 8.3%;Gemini 是 93 条中 0 次。

每题三次限制了单个问题能说明的东西:它的比率只能读出 0%、33.3%、66.7% 或 100%。这些运行还集中在一个压缩的时间窗口内,没有做时间间隔;Gemini 这条腿调用的是浮动模型别名、没有固定模型;每条回答仍记录了确切版本号(gemini-3.5-flash-lite)。这是 Canlah AI 自己流程里的测量缺口,不是客户结果。

另一份归档的客户审计直接测试了深度这件事:它保存了 503 条完整回答,其中 OpenAI 和 Gemini 各 240 条,分布在 60 个引擎、层级与问题的组合上,共有 3,821 条引用实例和 409 个唯一域名。采集成本为 86 美元。这些证据说明两种指标各自需要多大的样本量;它并不能说明两者与营收之间是什么关系。

提及率和被引信源需要不同的样本量

在那份客户审计里,品牌提及率不随深度变化。开放式问题 262 条中 0 次提及,品牌问题 192 条中 192 次;在一轮、两轮、三轮和八轮下结果相同。被引信源集合的表现完全不同。到第八轮时,中位数的分组仍在新增一个域名,只有 36% 的分组在那一轮什么都没新增。

固定跑两轮,只覆盖了八轮所找到域名的中位 50%。要达到 95% 的召回率需要 5.6 轮,相对八轮只省下 30%。没有任何一条停止规则能同时做到省钱和完整。

提及率那个结果有它自己的边界:两个数字都是饱和的极端值,归档里没有任何处在 30% 到 60% 之间的品牌 —— 而那正是多跑几轮最有价值的区间,所以「一轮就够」只在饱和情形下成立。引用份额和提及率是两台不同的仪器,不是同一个仪表的两次读数。

一个可见度数字需要多少问句、多少次运行

需要的深度取决于被测的比率,以及买家想分辨出多大的差异,所以没有普适的问句数量。对一个观测值为 30% 的品牌,20 条回答给出的 95% 区间是 14.5% 到 51.9%。60 条收窄到 19.9% 到 42.5%,100 条到 21.9% 到 39.6%,300 条到 25.1% 到 35.4%。

这些区间划定了一份报告可以诚实地称之为「变化」的最小幅度。在 20 条回答下,从 30% 到 45% 的移动仍落在噪声之内。

跨层证据加上了第二重约束。那份 12 个问题的审计给上面 0.103 的重合度配了一个 95% 区间:0.074 到 0.132。品牌命中的一致率整体为 83.3%,但在四个有信号的问题上只有 50%。关于买家实际会看到什么的结论属于浏览器层;API 采样适合做规模和趋势。

五层测量记录

对任何要用来支撑预算的 AI 可见度数字,Canlah AI 提出一份五层记录。

五层记录,取自 Canlah AI 2026 年 9 月 7 日自我审计的实际做法。

层级 要记录什么 它支撑的判断
1 预注册问题集 问题集、生成规则、品牌问题与开放式问题的拆分、市场与语言,采集前固定 这个结果是测出来的,还是写进问题里的
2 采样计划 每题在每个引擎上的运行次数、时间间隔,提及率与信源发现各自的 n 深度配不配得上所声称的精度
3 证据记录 完整回答、被引 URL、时间戳、锁定的模型版本、API 层还是浏览器层、失败的运行 任何一个数字能否回溯到原始回答
4 区间报告 分引擎、分层的比率、分母与区间;品牌问题结果单独报告 观测到的变化是否超过采样噪声
5 可比复测 同一问题集、尽可能相同的模型版本、相同的 n,前后都带日期 某个动作是否与一次变化相关联,而不声称因果

信源:Canlah AI 的报告标准,2026 年 9 月 23 日。这是一份建议买家去索取的标准,不是行业规范。

有问题集但没有采样计划,得到的是一个看起来很精确、精度却未知的数字。有采样计划但没锁定版本,得到的是一次无法比较的复测。更大的看板不等于更深的样本。

买家应该验证什么

  • 问清每个报出的比率背后、分引擎分天各有多少条回答,以及单次采集中每题跑了几次。
  • 要求在每个提及率旁边给出区间,或给出能算出区间的原始计数。
  • 检查品牌问题和开放式问题是否用各自的分母分开报告。
  • 确认每个数字来自哪一层 —— API 还是浏览器 —— 以及模型版本有没有被锁定。
  • 索取一个阳性对照:一个品牌肯定应该出现的问题,走同一条流水线跑一遍。

把这五个回答当成检验本身,而不是厂商给出的分数。一个无法按标注日期从原始记录里重新跑出来的数字,是一种说法,不是一次测量。

Canlah AI 的位置

Canlah AI 是一家总部位于新加坡的 SEO + GEO 公司,测量并提升品牌在 ChatGPT、Gemini、Google AI Overviews、Google AI Mode 中的可见度,并以可重新验证的区间和附时间戳的证据回报 AI 可见度。

它最适合那些需要一个「可靠到足以据此立项」的可见度数字的品牌,而不是每一家只想要廉价每日看板的公司。公司自己的归档也显示了截至 2026 年 9 月 23 日的边界:中段比率的校准仍是空白,自我审计跑的时候 Gemini 版本没有锁定。AI 可见度服务商在 2026 年正是在这一层上竞争。

方法与局限

SparkToro 的数字来自有厂商关联的研究,基于志愿者从美国消费者界面提交的样本,不是独立基准测试。工具套餐细节来自 2026 年 9 月 23 日审阅的公开定价页与帮助文档;未使用付费账号,服务商内部的采样做法可能与公开描述不同。Canlah AI 的数字来自其 2026 年 9 月 7 日的自我审计归档,以及 2026 年白皮书中汇总的脱敏客户审计归档。这些数据集不是一次配对实验。上文的区间是二项分布的示例计算,不是对任何具名品牌的估计。

常见问题

AI 可见度的测量问题到底是什么?

AI 可见度的测量问题在于:那个被当成既定事实呈现的分数,只是一次抽样,而被抽样的输出每跑一次都会变。在 SparkToro 2026 年 1 月 27 日的研究中,同一个问句的任意两条回答返回同一份品牌名单的概率不到百分之一。跨多次重复回答算出来的比率仍然有意义,而从「每天一条回答」里读出的排名或提及则没有。

AI 可见度工具准不准?

不准。单次每日读数并不具备多数买家默认的那种准确性。AI 可见度工具可以把回答数清点正确,但「每个问句每天一条回答」采样的是一个不稳定的输出,所以这个数字带着一个区间,而 2026 年 9 月 23 日审阅的四个页面都没有写出这个区间。准确性要靠重复运行、品牌问题与开放式问题各自的分母,以及锁定的模型版本来改善。

测量 AI 可见度需要多少个问句?

没有普适数字,因为精度取决于回答总数,而不只是问句数量。对一个在 30% 附近的品牌,20 条回答给出的区间大约是 15% 到 52%,300 条则收窄到大约 25% 到 35%。Canlah AI 自己的自我审计用了 32 个开放式问题,在两个引擎上每题三次,报出的区间仍然是 1.9% 到 7.9%。

相关阅读

免费白皮书

智能体时代的营销

13 章全文公开,不设邮箱门。含 50 家跨境 DTC 品牌智能体就绪度的原创数据集。

免费读全文 →