一个让很多人困惑的现象

如果你曾经多次向 ChatGPT 问同样的问题,你一定注意到答案会有所不同——有时候提到 A 品牌,有时候提到 B 品牌,有时候根本不提品牌只描述类别特征。这种随机性不是偶然的,而是 AI 语言模型的基本特性。

2026 年发表的研究《Quantifying Uncertainty in AI Visibility》(Sielinski, arXiv:2603.08924)首次系统量化了这种不确定性:AI 可见性的测量具有显著的跨时间和跨采样波动,单次观测不足以作为可靠的决策基础。

AI 回答为什么会波动

AI 大模型的回答随机性来自多个层面:温度参数——大多数语言模型在生成文本时使用了温度参数,即在每个词的预测中引入随机性,使得即使完全相同的输入也会产生不同的输出。检索索引变化——对于启用联网搜索的 AI,检索结果会随时间变化,反映最新的网页内容,这会影响哪些来源进入最终答案。模型版本更新——AI 平台会定期更新底层模型,可能改变对同一问题的回答风格和内容选择。地区和语言变量——同一个问题用不同语言提问、在不同地区访问,会触发不同的检索和回答逻辑。

波动有多大:研究的核心发现

这项研究的核心发现让人警醒:对于相同的品牌相关查询,在跨日重复采样中,品牌可见性的变化幅度可以非常显著。这意味着:如果你今天做了一次 GEO 分析,得到品牌出现在 60% 的相关问题答案中,明天重新测试可能得到 40% 或 80%。这个差距不一定反映了你的内容有任何变化,而是测量本身的噪声。

基于单次测量做出排名提升了 X% 这样的结论,在统计意义上可能是不成立的。

样本量决定结论可信度

这项研究的重要实践启示是:GEO 分析的可信度很大程度上取决于样本量,即对同一个提问做了多少次重复测试。

单次测试只能告诉你在这一次 AI 是这样回答的。10 次重复测试开始能看出大致分布。50 次以上的重复采样才能提供统计上有意义的置信区间。

对于大多数实际应用场景,关键提问至少应该做 10 到 30 次重复采样,并且标注测试时间窗口,以区分短期随机波动和真实的可见性变化。

置信区间而非单点数字

这项研究推动了 GEO 分析工具从给出一个分数转向给出一个置信区间。区别在于:单点数字,你的 GEO 可见性得分是 65 分,这在统计上可能没有意义,因为 95% 置信区间可能是 40 到 90 分。置信区间,基于 30 次采样,品牌提及率为 60%(95% 置信区间 45% 到 75%),这才是可以用于决策的信息。

这也是 Broccoli AI GEO 在报告中始终展示样本量、采样时间和置信说明的原因:一个透明的不确定性表达,比一个看似精确实则误导的分数更有价值。

在实践中如何应对不确定性

理解了 AI 可见性的不确定性,以下几个实践建议会更有帮助:不要基于单次测试做重大决策,用多次测试建立基线,然后在优化后重新多次测试,通过对比两个分布而不是两个点来判断变化。区分短期波动和趋势变化,如果品牌可见性连续多次测试都有系统性下降才值得深入分析原因,偶发的低数值可能只是随机噪声。重点关注稳定出现的问题,如果在多次测试中某类提问从未出现你的品牌,这比偶尔不出现更值得重视。追踪竞品的相对变化,即使绝对数字有噪声,你与主要竞品的相对差距通常更稳定,是更可靠的信号。