跳到主要内容
方法论约 9 分钟···海外传媒

AI Citation Score 方法论:可复现的 GEO 可见度测量标准

海外传媒 GEO 项目的核心测量标准:版本化 prompt、测试环境、原始证据、提及覆盖率、引用覆盖率、来源覆盖与事实准确率,以及 AI Citation Score 的适用边界。

方法版本 1.0 · 2026-09-05

先定义测量对象,再谈“AI 可见度”

随手问一次 AI,只能得到一张快照。问题措辞、地区、会话上下文、产品入口和测试时间都可能改变结果; 如果这些条件没有记录,本月与下月的数字就无法可靠比较。

这套公开方法把一次 GEO 审计拆成测试协议、原始证据、四组指标和解释边界。 它是海外传媒 GEO 项目的核心测量标准,也可以由团队自行复现。它不是任何 AI 平台的官方指标,也不代表模型排名。

最小可复现测试协议

  1. 1

    锁定问题集:选取 5–10 个真实购买问题,覆盖品类发现、场景推荐、竞品替代和品牌核验。保留原始措辞与意图标签;调整时创建新版本,不覆盖旧数据。

  2. 2

    记录测试环境:逐条保存日期、地区、语言、平台、产品入口、登录状态,以及界面能确认的模型或模式。无法确认的字段标记为 unknown,不自行推断。

  3. 3

    使用独立会话:每个问题从新会话开始,不追加引导性追问。清洁会话只能减少历史上下文影响,不能消除平台实验、个性化和模型更新带来的波动。

  4. 4

    保存原始证据:保留完整回答、截图、品牌出现位置、显示的引用 URL 与访问状态。摘要表必须能够回到原始记录复核。

核心仪表盘:不要把四个问题压成一个数字

“提到品牌”和“给出可核验引用”不是一回事。不同产品展示来源的方式也不同,因此报告应并列展示以下指标, 并按平台拆分;不适用的数据不应硬凑成零分。

提及覆盖率

提及品牌的有效(prompt × 平台)组合数 ÷ 有效组合总数

回答品牌是否进入候选集,不等于有引用证据。

引用覆盖率

提及品牌且显示至少一个支持性来源的组合数 ÷ 有效组合总数

仅记录界面实际显示的来源;不显示引用的平台应标记 N/A。

来源覆盖

有效引用 URL 数、唯一域名数及来源类型分布

判断可见度是否过度依赖单一页面或单一域名。

事实准确率

抽查字段中准确项数 ÷ 已核验字段总数

核验名称、品类、功能、地区、价格等关键事实,错误比缺席更需要优先处理。

AI Citation Score 如何计算

为保留一个便于看趋势的摘要数,我们将 AI Citation Score(ACS)严格定义为 “品牌被提及,且界面显示至少一个能够支持该提及的来源”的测试组合占比:

ACS = 有来源支持的品牌提及组合数 ÷ 有效测试组合数 × 100

例如 10 个问题在 3 个平台形成 30 个有效组合,其中 9 个提及品牌,6 个同时显示支持性来源, 则提及覆盖率为 30%,ACS 为 20%。如果某个平台不显示可点击引用,该平台仍可计算提及覆盖率,ACS 则标记为 N/A, 不与其他平台强行合并。

ACS 只适合在同一方法版本、同类测试环境下观察趋势。它不是行业基准,不能跨品牌、跨工具或跨协议直接比较。

每条结果必须保留哪些证据

测试批次与方法版本
Prompt 原文、意图标签与语言
平台、入口、地区、登录状态与可确认的模型信息
完整回答、截图和测试时间
是否提及、出现顺序与上下文语气
引用 URL、域名、来源类型与访问状态
事实错误、冲突信息与人工核验备注

只有摘要分、没有原始回答和 URL 的报告不可审计。来源 URL 还应区分官网、编辑媒体、商业合作内容、目录、论坛和其他类型, 但分类本身不等于质量判断。

如何读趋势,以及哪些结论不能下

  • 先看平台内趋势。至少保留连续批次,再讨论方向;单次升降只记录为观察。
  • 把来源变化当作线索。新媒体页面上线后出现引用,只能形成相关性假设,不能据此证明因果。
  • 把事实错误单独升级。错误价格、地区或产品能力可能伤害决策,应追查冲突来源并更新权威事实页。
  • 记录数据断点。问题集、平台入口或测试方式改变时升级方法版本,新旧批次不要画成无缝连续曲线。

方法边界

这套方法测量的是指定问题和测试条件下的可见度证据,不代表所有用户看到的答案,也不等同于流量、线索或收入。 第三方报道、官网内容、结构化事实和其他公开来源都可能参与检索与回答,但没有任何单一发布动作可以保证被某个平台引用。 合同应承诺可控制的研究、内容、发布与报告交付,而不是承诺 AI 答案。