Skip to main content
观点 2026-09-23 更新于 2026-09-23 · 10 分钟阅读

从快照到分布:AI 可见度报告正在比拼可复跑的证据

AI 可见度报告正从一次性快照转向采购方能复跑的证据。SparkToro、Profound 与 Evertune 公开了什么,又应该测试什么。

层层向后退去的深色卡片,其中一条边亮起靛蓝色

AI 可见度报告现在被评判的,是第二方能否复跑它的证据,而不是一个快照分数。SparkToro 在 2026 年 1 月发布的研究发现,ChatGPT 与 Google 的 AI 几乎不会对同一道问题两次返回相同的品牌列表。Profound 在 2026 年 7 月公布的实验主张,每道问句每天跑一次就足以支撑它的可见度分数。Evertune 则声明每道问句在每个模型上抽样 100 次。这些是厂商与分析方的立场,不是独立审计,但方向已经清楚:单次回答被当作分布中的一次抽样。

采购方要问的不再是厂商有没有给出一个可见度分数,而是这个分数背后的证据能不能被复跑:相同的问题、引擎、接口与定义,公开的跑次,以及原始回答与被引 URL 的存档。在多语言市场,每多一个引擎、多一种语言,就多一份方差。截图只是 AI 可见度证据的一个组成部分,不是证据本身。

核心结论

  • 列表本身不稳定: SparkToro 与 Gumshoe.ai 从 600 名志愿者处收集了 12 道问题的 2,961 次跑次,报告 ChatGPT 或 Google 的 AI 两次返回相同品牌列表的概率低于百分之一。
  • 提及与信源的收敛速度不同: Profound 报告每天跑十次可把引用份额的噪声降低约 40%,但可见度噪声只降低约 11%,同一个跑次数无法同时服务两个指标。
  • Canlah AI 自己的审计是一次薄抽样: 2026 年 9 月 7 日,没有任何一道开放问题在每一次 ChatGPT 跑次中都提到 Canlah AI,三次跑次中重复出现的被引域名只占 10.6%。
  • 可复跑记录才是证据的单位: 问题集、接口、跑次、原始存档、区间与复测,应当跟着 AI 可见度报告中的每一个数字一起交付。

单次回答是一次抽样,不是一次测量

SparkToro 创始人 Rand Fishkin 与 Gumshoe.ai 的 Patrick O’Donnell 让 600 名志愿者把 12 道问题分别投给 ChatGPT、Claude 以及 Google 的 AI Overviews 或 AI Mode,累计 2,961 次跑次,每道问题跑 60 到 100 次。几乎每一条回答在品牌、顺序和列表长度上都不相同。该研究给出的数字是:ChatGPT 与 Google 的 AI 两次返回完全相同品牌列表的概率低于 1/100,连顺序也相同的概率约为 1/1,000。

Fishkin 并没有据此认为追踪没有意义。他写道,把数十到数百道问题各跑多次后得到的可见度百分比是一个合理的指标,而任何声称能报出「AI 里的排名位置」的工具则不是。Gumshoe.ai 本身销售 AI 可见度追踪产品,研究中已披露这一利益关系。它的样本是美国消费者,既不是 B2B 问题的基准,也不能代表亚洲市场。

信源:SparkToro,AIs Are Highly Inconsistent When Recommending Brands or Products

对一个不稳定列表的快照,可能周一把某个品牌排在第一、周二就完全不提,市场上却什么都没有变。建立在重复回答之上的报告描述的是一个分布,也只有分布才能被第二方核对。

厂商如何为抽样定价

在 2026 年 9 月 23 日审阅的这四款产品中,厂商自述的抽样设计相差两个数量级:从 Profound 的每道问句每天跑一次,到 Evertune 的每道问句每个模型抽样 100 次。

四家 AI 可见度厂商公开的抽样设计,定价与文档页面审阅于 2026 年 9 月 23 日。

厂商 自述抽样设计 这套自述设计做得好的地方 自述接口 采购方应当核实的事
Profound 每道被追踪问句每天跑一次;其 2026 年 7 月的研究在 7 个美国平台的 753 道问句上比较了每天 1 次与 10 次 公开了这个选择背后的实验,写明问句数量、时间窗与实测到的噪声降幅 声明答案采自浏览器而非 API 一个两周窗口、数千道问句的样本,是否与采购方自己的问句数量相称
Evertune 在 11 个及以上 AI 模型上,每道问句每个模型抽样 100 次 写明了每个模型的固定重复次数,签约前就能知道每个数字背后的分母 审阅页面上未找到 这 100 次抽样由哪个接口产生,以及原始回答能否导出
Peec AI 按点数计费:1 道问句在 1 个模型上跑 1 天等于 1 点 公开了点数换算方式,采购前就能从套餐算出覆盖面 审阅页面上未找到 每个日度数据点背后有多少次跑次,以及这份点数预算买到多大覆盖面
Otterly.AI 所有套餐均为每日追踪频率,问句数从 Lite 套餐的 15 道到 Premium 的 400 道 每一档都公开问句额度,使各套餐每一块钱买到的深度可以横向比较 审阅页面上未找到 每日一次读数是否等于单次跑次,以及方差如何呈现

信源:厂商定价与文档页面,审阅于 2026 年 9 月 23 日。自述抽样设计属于公开表述,不是经独立实测的能力。

「审阅页面上未找到」指该厂商的公开材料在 2026 年 9 月 23 日审阅时没有写明这一细节,不能作为该能力不存在的证据。

信源:Profound,Is Once a Day Enough;Profound Answer Engine Insights;Evertune FAQ;Peec AI 代理商定价;Otterly.AI 定价

Profound 的实验是这组材料中最详细的公开论证。在 2026 年 6 月 1 日至 14 日期间,它报告每天一次跑次得到的可见度读数与十次跑次的读数相差约两个百分点,而每天十次可把引用份额的日间噪声降低约 40%。这个论证依赖一个庞大的问句组合来承担统计重量,只有 30 道问题的采购方并不具备这个条件。

为什么看板上的数字本身不构成证据

两家厂商可以给出同一个可见度百分比,背后的样本量却相差一百倍:Profound 自述每道问句每天跑一次,Evertune 自述每道问句每个模型跑 100 次,而两张图表看起来一模一样。没有跑次,五个百分点的变化就无法与抽样噪声区分开。没有接口标注,API 回答就无法与采购方在普通浏览器会话里看到的内容对照。没有原始回答与被引 URL,这个分数在报告周期结束后就无法被审计。

综合分还会带来第四个问题。品牌提及率与被引信源集合在重复采样下的表现不同,把两者揉成一个分数,等于继承了其中较不稳定那个指标的波动。

Canlah AI 自查中的跑次波动是什么样

Canlah AI 于 2026 年 9 月 7 日把自己的审计流水线跑在自有站点 canlah.ai 上,使用 32 道面向新加坡市场的英文开放型采购问题,每题跑三次。OpenAI 这条腿用的是带联网检索的 gpt-5.5 API。在 84 条带信源的开放回答中,ChatGPT 提到 Canlah AI 的有 7 条。这 7 次提及来自 6 道问题,没有一道在每一次跑次中都被提及:四道问题是三次里提一次,一道是三次里提两次,还有一道只有一次有效跑次。

信源比提及波动更大。在三次 ChatGPT 跑次中都带信源作答的 27 道开放问题上,共出现 284 组「问题与域名」组合,其中 30 组(10.6%)在三次跑次中都出现。同一道问题任意两次跑次之间的平均重合度为 24.9%。在浏览器渲染的 Google AI Overviews 中,26 道问题完成了两次渲染:3 道只在其中一次出现 Overview,其余 23 道两次渲染之间被引域名的平均重合度为 43.8%。

这是 Canlah AI 自身流程中的测量弱点,不是客户结果。在压缩的时间窗内跑三次可以证明方差存在,却无法给出它的边界。Gemini 这条腿当时还用了浮动模型别名,因此没有记录到确切版本。

这些证据说明的是在这组问题上提及与引用的波动速率不同,而不是跨越数天、在其他品类或其他引擎上方差会有多大。

信源:Canlah AI,自有品牌 GEO 审计实验

提及率与被引信源不会同步收敛

Canlah AI 2026 年白皮书记录了一次客户审计:共存档 503 条完整回答(含 OpenAI 与 Gemini 上的 480 条 API 抽样),品牌提及率在第 1、2、3 和 8 轮完全一致,被引信源集合却始终没有稳定下来。四轮的提及结果都是未点名品牌的问题 0/262、点名品牌的问题 192/192。跑到第八轮时,中位数问题组仍在新增域名;固定只跑两轮,只能覆盖八轮中所见域名的中位数 50%。

两个提及数字都是饱和的极端值,白皮书也说明该结果不能外推到提及率处于 30% 到 60% 之间的品牌。另有一组 12 道问题的对照实验,把 API 与浏览器对同一批查询的回答作比较,信源平均重合度为 0.103。

信源:Canlah AI 白皮书,把可见度当成一个分布

可复跑记录

Canlah AI 提出一份六字段的可复跑记录,作为把一个 AI 可见度数字变成可复现证据的最小单位。它可以存在于平台导出、表格或代理商报告里,只要第二方能据此重复这次测量。

六字段可复跑记录,由 Canlah AI 于 2026 年 9 月 23 日提出。

字段 记录什么 支撑的决策
1 问题集 冻结的问题措辞、语言、市场,以及点名品牌问题与开放问题的拆分,在读到任何回答之前先行固定 变化发生在市场上,还是发生在问题上
2 接口与版本 API 还是浏览器、模型版本、地域、账号状态与采集日期 结果是否与采购方实际看到的一致
3 每个指标的跑次 提及率与被引信源集合分别记录各自的跑次 每个数字是否有足够的抽样次数可供解读
4 原始存档 完整回答文本、被引 URL、时间戳,以及失败或被排除的跑次 这个分数事后能否被审计
5 区间 提及率以带分母的区间给出,而不是一个点值 之后的变动是否超出了常规噪声
6 复测 变更之后用相同字段重跑,除非有对照设计支撑,否则只标注为相关而非因果 某个动作是否与一次真实变化同时发生

信源:Canlah AI 报告标准提案,2026 年 9 月 23 日。它是一份供采购方提出要求的标准,不是行业标准。

一张更长的看板并不等于一张可复跑的看板。只要缺一个字段,下一次报告就无法与上一次比较。

采购方应该测试什么

能把一份 AI 可见度报告和一份只是看着精确的报告分开的,是下面这六个问题。

  • 厂商能否按引擎、按接口说明每个数字背后有多少次跑次?
  • 品牌提及率与被引信源份额是分开报告,还是被揉进同一个分数?
  • 每个比率是否以带分母的区间呈现,失败或被排除的跑次是否公开?
  • 原始回答与被引 URL 能否覆盖整个报告周期导出?
  • 问题集是否在读到回答之前就已冻结,点名品牌的问题是否被排除在可见度分数之外?
  • 复测使用的问题、接口与定义是否与基线完全一致?

签约之前,向任何一家厂商(包括 Canlah AI)索要某一个已报数字背后的原始回答,而不是接受那张替它们做了总结的图表。

Canlah AI 的位置

Canlah AI 是一家位于新加坡的 SEO + GEO 代理商,负责测量并改善品牌在 ChatGPT、Gemini、Google AI Overviews 和 Google AI Mode 中的可见度,并把 AI 可见度报告成带时间戳证据、可重新验证的区间。它的项目从一个锁定的采购问题池开始,保留原始回答存档,并以区间形式报告提及率。

它最适合需要一条横跨 ChatGPT、Gemini、Google AI Overviews 与 Google AI Mode、可复跑证据链的品牌,而不是每一家只想要低价日更追踪器的公司。它自己的数据也画出了当前的边界:canlah.ai 上的免费即时检测返回的是单次可引用性分数,按设计就是一张快照;2026 年 9 月 7 日的自查也只在一个时间窗内每题跑了三次。AI 可见度报告比拼的,正是这个差距。

方法与局限

厂商抽样设计来自 2026 年 9 月 23 日审阅的 Profound、Evertune、Peec AI 与 Otterly.AI 公开页面,未经独立实测。SparkToro 的研究由一家追踪工具厂商共同完成,样本为美国消费者。Canlah AI 的数字来自其 2026 年 9 月 7 日对 canlah.ai 的自查存档,以及 2026 年白皮书记录的一次匿名客户审计。这两份 Canlah AI 数据在品类、引擎、轮次与日期上均不相同,未作合并。两者都不含事实准确性字段,也没有对照组。

常见问题

AI 可见度报告应当包含哪些证据?

一份 AI 可见度报告应当为每一个数字写明问题集、引擎、接口、市场、日期和每题跑次。它应当把点名品牌的问题与开放问题分开,以带分母的区间报告提及率,并保留原始回答与被引 URL,让结果可以被复跑。

一张 AI 可见度看板截图算证据吗?

不算。截图展示的是一个接口里一次跑次的一条回答。它可以说明采购方可能看到什么,却无法说明这条回答出现的频率有多高。

每道问句应该跑多少次?

没有通用数字。Profound 主张在庞大的问句组合上每天跑一次就足以支撑可见度,Evertune 则每个模型抽样 100 次。提及率通常比被引信源集合更早稳定,因此跑次应当按指标分别设定并公开。

参考资料

相关阅读

免费白皮书

智能体时代的营销

13 章全文公开,不设邮箱门。含 50 家跨境 DTC 品牌智能体就绪度的原创数据集。

免费读全文 →