智能体时代的营销 · Canlah AI · 新加坡 SEO + GEO 机构
AI 答案是随机生成的。同一个提示词问两次,得到的品牌清单可能不同。这一点业内已有共识,但共识止步于此 —— 大多数供应商承认它,然后继续售卖单次测量得出的”排名”。
现有的最好证据来自一项覆盖三个德语区垂类、时间跨度为 2026 年 1 月 24 日至 3 月 20 日的研究(A−,预印本):品牌提及的日间 Jaccard 相似度为 0.45–0.59(消费电子 0.557、体育用品 0.453、电信 0.589);信源层面更不稳定,为 0.34–0.42。
换句话说:今天和明天问同一个问题,大约一半的品牌名单会变,而引用的信源有三分之二会变。
该研究排除了金融与房地产两个垂类,原因是品牌识别率低于 70%。这个排除本身值得注意 —— 它意味着在某些垂类里,连”品牌有没有被提到”都难以稳定判定。
我们在一次客户审计中归档了 503 份完整响应(OpenAI 240 + Gemini 240,其中带检索的各 227),覆盖 60 个”引擎 × 层 × 题目”组合,共 3,821 次引用实例、409 个唯一域名。该批数据的采集成本为 86 美元,二次分析零新增成本。
我们本来是想找一个”跑到信源收敛就停”的省钱阈值。结果推翻了这个设计:
| 指标 | 8 轮内的行为 | 需要几轮 |
|---|---|---|
| 品牌提及率 | 非指名层 0/262、指名层 192/192,k = 1 / 2 / 3 / 8 逐层完全相同 | 1 轮(取 2 轮作失败缓冲) |
| 引用信源集合 | 第 8 轮中位组仍在新增 1 个域名,基准覆盖率仅 0.88,仅 36% 的组该轮零新增 | 任何可负担的轮数都买不到 |
停止规则实测(召回率相对该组 8 轮全量并集):固定 2 轮的域名召回中位数仅 50%;要达到 95% 召回需要 5.6 轮,比现行的 8 轮只省 30%。没有任何阈值能同时做到省钱和保真。
由此得出本报告的核心方法论主张:
行业把两个性质完全不同的量混成了一个分数。 “我被提到了吗”便宜且立即稳定;“谁被引用了”昂贵且永不收敛。 任何售卖单一 AI 可见度分数的产品,都在拿一个已收敛的量,去平均一个从未收敛的量。
这条主张对采购方有直接的价值:品牌提及率可以低成本、高频率地测量(1–2 轮即可),因此值得作为持续监控指标;而“谁在被引用”的完整图景无法在合理预算内穷举,任何声称给出完整引用榜单的产品,都在报告一个截断的样本,并且通常不披露截断在哪里。
支撑”1 轮足够”的两个数字 —— 0/262 与 192/192 —— 是两个饱和端点。该品牌在不点名的品类查询中完全隐形,在点名查询中必然被提及。在端点上,“多测几轮结果不变”接近于平凡结论。
评分模型真正要服务的是中间态品牌(提及率约 30–60%),而这批数据里一个中间态样本都没有。 在补齐中间态标定之前,“1 轮足够”只对饱和情形成立,不可外推。
我们把这条局限写进正文,而不是附录,因为把结论外推到未测量的区间,正是本报告通篇在批评的行为。
我们怎么控制它: 在补齐中间态标定之前,对提及率处于中间区间的品牌,我们按二项分布计算所需样本量并据此定轮数,而不是套用”1 轮足够”;每份报告里的提及率都带区间,不给点值。换句话说,这条局限的代价由我们承担为更高的采样成本,不转嫁为客户报告里的虚假精度。
在另一次审计中(n = 12 题),我们把同一批查询同时投给 API 层与浏览器层,比较两层各自引用的信源集合:
Jaccard 均值 0.103(中位 0.105 · 标准差 0.046 · 范围 0.028–0.170 · 95% 置信区间 [0.074, 0.132])。
两层读的几乎是完全不同的文档。
这批数据还提供了一个自我拆穿的范例。表面上,两层的”品牌命中一致率”是 83.3%,看起来不错。但拆层之后:8 道”两层都说没命中”的空题一致率 100%(不提供任何信息),4 道真正有信号的题一致率 50% —— 等于抛硬币。83.3% 是被空题稀释出来的。
两个量必须分清,不可放在同一根轴上比较:
| 测的是什么 | 数值 | |
|---|---|---|
| 德语区研究(A−) | 同一层内、跨日的稳定性 | 品牌 0.45–0.59;信源 0.34–0.42 |
| Canlah(一手) | 跨层(API vs 浏览器)、同日 | 信源 0.103 |
正确的合并表述是:跨层分歧的幅度约为跨日波动的三倍。 不可表述为”Canlah 测得的一致率低于学术研究”—— 那是把两个不同的量当成同一个量比较。
实务含义: 交付给客户的”AI 里怎么说我们”的断言,头牌证据必须是浏览器可复现的界面截屏。API 适用于规模、趋势与相对份额;凡客户能在自己浏览器里一句话证伪的断言,必须过浏览器这一关。我们在一个真实案例中观察到:同一品牌、3 个引擎 × 3 个日期,API 层稳定输出错误答案(称其未开业),而浏览器层同期输出正确答案。
基于以上,本报告提出四条最低标准,并公开承诺 Canlah 的交付遵守它:
这四条都不需要专有技术,任何同行都可以采用。我们公开它,是因为在一个测量不可靠的品类里,可复核性本身就是唯一可辩护的差异化。