白皮书 · 第 12 / 13 篇全文在线版

附录 A · 方法与局限

智能体时代的营销 · Canlah AI · 新加坡 SEO + GEO 机构

约 4 分钟读完 · 2026-08

你正在读的就是完整正文,不是摘要 —— 全书 13 篇全部免费在线公开,无需注册。PDF 只是同一份内容的打印版。

47 / 50就绪度审计中可达的站点数
64对同题两层配对,来自三个真实客户审计

A.1 智能体就绪度审计(第 5.3 节)

采集时间: 2026 年 8 月 11 日 样本: 50 个中国跨境 DTC 品牌独立站,47 个可达 方法: 只读 HTTP 请求。检测 /.well-known/ucp/.well-known/agent-payments/llms.txt/.well-known/ai-plugin.json/.well-known/mcp.json/robots.txt,以及首页与一个自首页发现的商品页上的 JSON-LD / microdata 结构化数据。单次请求,12 秒超时,并发上限 8,携带可识别的 User-Agent 与联系邮箱。无认证、无表单提交、无写操作。

内容校验(关键): HTTP 200 不计为命中。UCP 与其他 JSON 端点须能解析为 JSON 对象且含相应键;llms.txt 须为纯文本且非 HTML。未加校验的初测将 UCP 就绪率虚报为 59.6%,加校验后为 53.2% —— 差额全部来自 SPA 的软 404(对任意路径返回首页 HTML 并带 200 状态码)。

已知局限:

  1. 便利抽样,非随机抽样。 样本按品类代表性人工选取,不可外推至全体中国跨境 DTC 品牌。
  2. 单次单点采集。 未做多地域、多时段重复,不排除区域路由差异或反爬拦截造成的漏检。
  3. 结构化数据只覆盖两个页面。 首页 + 一个商品页,不代表全站覆盖率。商品页通过首页链接正则发现,可能未命中部分站点的主力 PDP。
  4. Merchant Center 状态无法外部检测。 UCP 清单存在不等于 Google 侧接入完成 —— 后者还需有效的 Merchant Center 账户与可结账商品,本审计无法验证。因此「UCP 就绪」应读作「具备清单这一必要条件」,而非「已可被 Google 代理结算」。
  5. 平台归因为启发式判定。 依据首页中的 cdn.shopify.com 等特征串,可能误判使用了自定义 CDN 的站点。

原始数据与脚本: _source/agent_readiness_results.json_source/agent_readiness_audit.py

「HTTP 200 不计为命中」:UCP 就绪率从 59.6% 降到 53.2%
同一份原始数据,未加校验的初测虚报为 59.6%,加校验后为 53.2% —— 差额全部来自 SPA 的软 404。这是本报告「返回了 ≠ 返回的是你要的东西」的第一个现场。

A.2 采样轮次标定(第 4.2 节)

数据: 单次客户审计的 503 份归档响应,其中 API 层样本为 OpenAI 240 + Gemini 240(带检索的各 227),60 个「引擎 × 层 × 题目」组合,58 组轮数 ≥ 5;3,821 次引用实例,409 个唯一域名。采集成本 86 美元。

已知局限: 单一品牌、单一垂类、单一市场。 品牌提及率的两个观测值(0/262 与 192/192)均为饱和端点,数据中不含中间态样本;因此「1 轮足够」的结论仅对饱和情形成立,不可外推至提及率处于 30–60% 区间的品牌。补齐中间态标定是本报告已识别的首要研究缺口。

A.3 两层一致率(第 4.4 节)

数据: 单次客户审计,n = 12 题,同一批查询同时投放 API 层(Gemini 8 轮 + OpenAI 8 轮 = 16 样本)与浏览器层。

已知局限: 样本量小。 Jaccard 均值 0.103 的 95% 置信区间为 [0.074, 0.132];品牌命中一致率的置信区间宽达 40 个百分点(整体 83.3%,Wilson 95% CI [55.2%, 95.3%])。结论应作为结构性方向判断引用,不应作为精确测量引用。单一品牌、单一垂类。

n = 12 的品牌命中一致率:整体 83.3%,95% 置信区间宽达 40 个百分点
单次客户审计,n = 12 题(API 层 Gemini 8 轮 + OpenAI 8 轮 = 16 样本)。品牌命中一致率整体 83.3%,Wilson 95% CI [55.2%, 95.3%];Jaccard 均值 0.103 的 95% 置信区间为 [0.074, 0.132]。区间这么宽,结论只应作为结构性方向判断引用,不应作为精确测量引用。

A.5 跨客户两层对照(第 8.5 节)

采集时间: 归档数据的二次分析,分析日 2026 年 8 月 13 日,零新增采集成本。

样本: 三个真实客户审计归档(MathleteTraining / OpenKids / Canlah 自审)中,同一条查询同时存在浏览器层与 API 层记录的配对,共 64 组。浏览器层引擎为 google_ai_mode 与 serpapi_ai_overview;API 层为 gemini 与 openai。

方法: 查询文本归一化(去多余空白、统一小写)后匹配;各层的引用域名取并集后计算 Jaccard 相似度。域名规范化去除 www. 前缀。

一个必须披露的实现细节: 两层的信源存放位置完全不同 —— 浏览器层是扁平的 sources 列表,API 层埋在服务商的原始 grounding 返回里。Gemini 的每个引用 URI 都包着 Vertex 重定向(vertexaisearch.cloud.google.com/...),真实域名只存在于 web.title 字段。初版脚本只读 URI,导致每条引用都被解析成同一个重定向域名,Jaccard 被静默算成 0.000。修正后为 0.096。我们记录这个错误,是因为它与本报告第 5.3 节的软 404 属于同一类:外部数据「返回了」不等于「返回的是你要的东西」,而错误的那一版看起来完全正常。

已知局限:

  1. 3 个品牌、64 组配对,均为我们自己的客户,非随机抽样。 不可外推至全行业。
  2. 配对依赖查询文本匹配。 两层的提问措辞可能存在细微差异,少量配对可能并非严格同题。
  3. 各层的轮数与引擎组合不完全对称(API 层多轮、浏览器层单轮),因此比较的是「该层在该题上引用过的域名并集」,不是逐轮对比。
  4. 归档污染,复跑时发现(2026 年 9 月 1 日)。 为本报告画图而复跑配对脚本时发现,MathleteTraining 的归档里还装着一整轮 OpenKids 探测 —— 是我们自己的管线在 2026 年 7 月 29 日因并发缺陷错放进去的;原归属于 MathleteTraining 的 32 组里有 16 组实为 OpenKids 的题。64 组、均值 0.096、中位数、sd、置信区间与 21 组零重合全部不受影响 —— 它们都不依赖「某一组属于哪个客户」。变的是:逐客户 n 变为 16 / 32 / 16,逐客户均值变为 0.114 / 0.100 / 0.070;「是否被引用」的分歧为 15 组而非 11 组,且 15 组全部是 API 命中、浏览器未命中;样本覆盖的是两个垂类、两个市场,不是三个 —— 此前「三个不同垂类、不同市场」那句撤回。我们发布这个更正而不是更好看的版本,因为这正是本报告要求别人做到的标准。

原始脚本与结果: _source/browser-vs-api-comparison.py_source/browser-vs-api-results.json。可直接复跑。

64 组两层配对是怎么算出来的,以及初版脚本在哪一步把 Jaccard 静默算成 0.000
错误的那一版看起来完全正常——这张图标出的是「哪一个字段」决定了整个结论,它与第 5.3 节的软 404 属于同一类。

A.4 关于本报告的证据构成

本报告引用的学术文献中,仅一篇经过同行评审(Aggarwal 等,KDD ’24)。其余学术引用均为 2026 年预印本,一律标注 A−。这不是掩饰,是这个领域的现状:研究速度快于同行评审周期。读者应据此调整对相关结论的置信度。


本报告全文免费公开。如需 PDF 版本(便于转发与归档),到白皮书主页留邮箱获取 →