方法论约 5 分钟·

AI 引用得分:如何量化品牌在 AI 搜索里的可见度

「品牌在 ChatGPT 里出现吗」不能靠感觉回答。这篇文章公开我们在月度报告里使用的测量方法:固定 prompt 集 × 三个引擎 × 清洁会话,以及 AI 引用得分的计算与解读方式。

「AI 里搜得到你吗」不能靠感觉回答

越来越多创始人开始关心一个新问题:ChatGPT 推荐同类工具时会不会提到我? Perplexity 回答我客户的问题时,引用的是我还是竞品?

大部分人的检验方式是随手问一次 AI,看一眼结果。这种做法有两个问题: 一是不可比——这个月问和上个月问,措辞、会话上下文、模型版本都可能不同, 结果的变化说明不了任何事情;二是不可归因——就算发现自己被提及了, 也不知道是哪条外部信号起了作用,下一步该在哪里加码。

测量不了的东西就管理不了。这篇文章公开我们在月度报告里实际使用的量化方法, 你完全可以拿去自己执行。

测量协议:固定 prompt 集 × 三个引擎 × 清洁会话

方法本身很朴素,关键在于纪律性——每个环节都是为了让逐月数据可比:

  • 固定 prompt 集:选 5–10 个真实的购买意图 prompt—— 你的客户会怎么问 AI,就怎么写。例如「best [品类] tools for [场景]」 「[品类] software comparison」「[头部竞品] alternatives」。 Prompt 集一旦确定就锁死,不随意更换;确需调整放在季度复盘时做,并在数据里标注断点。
  • 三个引擎:ChatGPT、Perplexity、Google AI Overview 分别运行。 三者的引用来源偏好不同(Perplexity 更依赖实时检索,ChatGPT 更依赖训练语料与联网检索的混合), 分开记录才能看出结构。
  • 清洁会话:无登录或全新会话执行,排除个性化和历史上下文的干扰。 每月固定同一天运行,减少模型版本切换带来的噪音。
  • 记录三件事:是否被提及、提及的位置(第几个被推荐)、 以及回答引用了哪些来源(这一列后面会讲,是全表最值钱的一列)。

AI 引用得分:一个足够用的单一数字

10 个 prompt × 3 个引擎 = 30 个组合。得分公式:

AI 引用得分 = 被提及的(prompt × 引擎)组合数 ÷ 组合总数 × 100

例如固定 10 个 prompt × 3 个引擎,共 30 个组合:ChatGPT 提及 4 次、Perplexity 3 次、AI Overview 0 次, 得分就是 7 ÷ 30 × 100 ≈ 23 分。

这个数字本身没有绝对意义——23 分不代表「好」或「差」,它的价值在于逐月对比。 第一次测出 0 分也完全正常:零分是基线,不是失败。 对大多数刚出海的品牌来说,第一次测量的意义就是把「我们在 AI 搜索里不存在」 从模糊的焦虑变成一个可以改变的数字。

怎么解读:趋势和归因,而不是单月数字

两条解读纪律:

  • 只看 3 个月以上的趋势。AI 引擎的行为存在波动,模型更新、检索策略调整 都会造成单月起伏。单月的升降不构成任何结论,连续一个季度的方向才算信号。
  • 归因列比得分更重要。当品牌被提及时,AI 引用了哪个来源? 如果 Perplexity 两次提及都引用了三个月前投放的某篇媒体评测, 这说明该类型的 placement 正在进入引用池——下一步就应该在同类媒体上加权。 得分告诉你「有没有变化」,归因告诉你「下一步做什么」。

这也是为什么我们把这套审计做成月度报告的固定板块:单次测量是一张快照, 连续 12 个月的测量才是品牌的 AI 可见度档案。

这套方法的边界,也要说清楚

第一,它测量的是「可见度」,不是「转化」——被 ChatGPT 提及不等于拿到订单, 它解决的是入围问题。

第二,它不适合作为承诺指标。AI 引擎不出售位置,任何「保证被引用」的承诺都不可信。 合同里应该承诺的是可以兑现的交付(高质量外部提及的建设动作),AI 引用按月追踪。

第三,方法论需要版本化。引擎在演化,prompt 集和引擎清单都可能需要调整—— 重要的是把每次调整记录为数据断点,而不是假装数据始终连续。 不变的是底层逻辑:真实、高质量的第三方提及,永远是被 AI 引用的最可靠基础。 测量只是让这件事的进展变得可见。