先统一口径,再谈数字
GEO 讨论中最常见的问题是同一份数据被双方按不同口径解读。因此在看任何数字之前,必须先确认四个问题:分母是什么、分子如何判定、采样了多少次、以及跨哪些平台。
分母通常是采样提问的总条数,但也可以是有效回答数——如果部分提问因平台故障未返回结果,把它们计入分母会低估可见性。分子则取决于判定规则:品牌名出现算提及,还是必须被正面描述才算。
这两处口径差异足以让同一个站点的提及率在 20% 与 45% 之间摆动。因此任何 GEO 报告在横向对比前,第一件事是确认口径一致。
四项核心指标的定义
提及率:在采样提问的回答中,品牌被以任何形式提及的比例。这是最宽松的指标,也是水位指标,反映 AI 是否知道你存在。
推荐率:在提及的基础上,品牌被作为建议选项直接推荐给用户行动的比例。推荐率的分子一定是提及率分子的子集,因此推荐率不可能高于提及率。二者差距过大通常说明品牌被知道但不被信任。
引用率:品牌自有页面被作为来源链接引用的比例。这是最严格的指标,也是唯一能直接带来点击的指标。它衡量内容是否被认为是可引用的证据来源。
Share of Voice:在同类提问中,你的提及次数占所有竞品提及总次数的比例。它消除了行业整体波动,是判断相对位置的正确指标。
这四个指标应当一起看。只看提及率会高估效果,只看引用率会低估品牌建设的进展。
什么样的数值算健康
先说明前提:跨行业的绝对基准意义有限,因为竞争强度差异巨大。以下区间适用于中等竞争强度的 B2B 与内容型站点,供建立初始预期参考。
提及率低于 10% 通常意味着存在技术准入或实体识别问题,应先做审计而非内容优化;10% 到 30% 属于起步区间,说明品牌已被部分识别;30% 到 50% 是多数优化投入后的合理区间;超过 50% 一般只出现在品类定义者或高权威站点。
推荐率与提及率的比值是更有信息量的信号。比值高于 0.6 说明品牌被提及时常被正面推荐,内容具备说服力;低于 0.3 说明品牌被知道但不被采信,问题出在内容可信度而非可见性。
引用率的健康区间更低,多数站点在 5% 到 15% 之间。超过 20% 说明内容已成为该话题的重要证据来源。
为什么单次采样不足以判断
AI 回答具有随机性:同一条提问在不同时间、不同会话、甚至同一模型的相邻两次调用中都可能给出不同答案。这意味着 GEO 指标本质上是随机变量的观测值,而非确定值。
正确做法是对同一组提问重复采样,并用置信区间表达不确定性。对比率型指标,Wilson 区间在小样本下比正态近似更稳健:采样 30 次、提及 6 次时,点估计是 20%,但 95% 区间大致覆盖 9% 到 38%。
这个宽度意味着:如果你上周测到 20%、这周测到 26%,在 30 次采样下这完全可能是随机波动,不能判定为改善。判断趋势需要区间的实质性分离,或者把采样次数提高到 100 次以上以收窄区间。
Broccoli AI GEO 对核心意图默认重复采样并给出方差,正是为了避免把噪声读成结论。报告中应优先看区间而非点值。
五个常见误读
误读一:把提及率上升等同于业务增长。提及率反映可见性,不反映转化。若推荐率与引用率同步上升,才有实际意义。
误读二:用不同提问集对比两轮结果。提问集变化会让结果完全不可比,必须固定提问集。
误读三:只看自有品牌不看竞品。行业整体可见性上升时,你的提及率可能上升但相对位置下降。应同时观察 Share of Voice。
误读四:把单平台结果外推到全部 AI。不同平台的检索策略与语料差异显著,ChatGPT 与 Perplexity 的表现分离是常态而非异常。
误读五:忽略采样时间分布。集中在一小时内采样会引入时间相关性,样本并非独立。应将采样分散到数天内的不同时段。
建立可复现的度量流程
第一步固定提问集:选取十到十五条与业务强相关的提问,覆盖品类词、场景词与条件约束词三类,写成文档并版本化管理,任何修改都记录时间与原因。
第二步固定采样配置:采样次数、平台列表、时间窗口三者固定,建议每周或每两周一轮,采样分散在不同日期与时段。
第三步固定判定规则:明确什么算提及、什么算推荐、什么算引用,写成规则文档,避免每轮人工判断口径漂移。
第四步建立对照组:同时跟踪三到五个主要竞品的同期表现,用于分离行业波动与自身变化。
第五步按季度回顾:观察四个指标的区间移动方向,而非单轮数值。真正的改善应当表现为连续三轮以上的区间整体上移。