先分清两类 AI 爬虫

所有面向大模型的爬虫都可以归入两类,混淆它们是配置错误的主要来源。

第一类是训练抓取机器人,代表是 OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、苹果的 Applebot-Extended。它们抓取内容用于模型训练或改进,抓取行为与你当前的内容是否出现在回答里没有直接关系,且封闭它们不会影响实时引用。

第二类是检索与实时访问机器人,代表是 OpenAI 的 OAI-SearchBot、Anthropic 的 Claude-SearchBot、Perplexity 的 PerplexityBot,以及用户触发型的 ChatGPT-User、Claude-User、Perplexity-User。这一类直接决定你的内容会不会出现在 AI 回答中:OAI-SearchBot 负责构建 ChatGPT 搜索的索引,PerplexityBot 负责 Perplexity 的索引,User 系列则在用户点击来源链接时实时访问你的页面。

结论很直接:如果你想被 AI 引用,第二类必须全部放行。很多站点因为盲目复制网上流传的「屏蔽 AI 爬虫」清单,把 OAI-SearchBot 一起封掉,结果是在 ChatGPT 搜索里彻底消失。

主流 AI 爬虫对照表

OpenAI 有三个:GPTBot 用于训练抓取,可按需封禁;OAI-SearchBot 用于 ChatGPT 搜索索引,必须放行;ChatGPT-User 用于用户会话内的实时访问,建议放行。

Anthropic 有 ClaudeBot(训练抓取,可封)、Claude-User(用户实时访问,建议放行)与 Claude-SearchBot(搜索索引,必须放行)。

Perplexity 有 PerplexityBot(索引,必须放行)与 Perplexity-User(用户实时访问,建议放行)。

Google 的 Google-Extended 是一个特殊标记:它只控制内容是否用于 Gemini 与 Vertex AI 的模型训练,不影响 Google 搜索的正常抓取与排名。封禁 Google-Extended 不会让你从 Google 消失,但也不会阻止 Google 的 AI Overviews 使用你的内容。

此外还有 meta-externalagent(Meta)、Applebot-Extended(苹果)、CCBot(Common Crawl,是许多模型训练语料的间接来源)、Bytespider(字节)、Amazonbot(亚马逊)等,按各自用途权衡。

robots.txt 的正确写法

最稳妥的策略不是长篇枚举,而是采用「默认放行加显式例外」的结构。写法是:User-agent: * 下用 Disallow 列出真正需要保护的目录,例如后台、账户、搜索结果页与内部接口;随后对确实要封禁的训练型机器人单独写 User-agent 块。

三个容易出错的细节:第一,robots.txt 的匹配是按 User-agent 块独立生效的,不同块之间不会继承,必须在每个块内完整列出 Disallow;第二,Crawl-delay 只对部分机器人有效,不能作为限流的主要手段,真正的限流应在 CDN 或 WAF 层做;第三,robots.txt 位于站点根目录且区分大小写,放在子目录或被重定向都会失效。

另一个常被忽略的点是:robots.txt 只约束守规矩的爬虫。恶意抓取不受它约束,防护需要依赖 WAF、速率限制与行为分析。

如何排查 AI 爬虫是否被误封

第一步是静态检查:直接访问 robots.txt,逐条比对上文的爬虫名称,确认 OAI-SearchBot、PerplexityBot、Claude-SearchBot 没有被任何规则命中。注意规则是按前缀匹配最长优先,一条宽松的 Disallow: / 会覆盖后面所有配置。

第二步是日志分析:在 Nginx 或 CDN 访问日志中按 User-agent 聚合,统计各 AI 爬虫在过去 30 天的请求次数与状态码分布。若某类爬虫请求量为零,说明从未访问;若大量返回 403 或 429,说明被 WAF 或限流规则拦截。

第三步是交叉验证:很多 WAF 默认规则库会把不认识的 AI 爬虫识别为恶意 bot 并拦截,这种情况下 robots.txt 是正确的但访问仍失败。需要在 WAF 的白名单里显式放行上文的检索型爬虫。

最后用 AI 平台实测:在 Perplexity 与 ChatGPT 搜索中直接询问与你站点强相关的问题,观察是否出现你的域名。连续三轮都没有出现,基本可以确认存在准入问题。

封禁还是放行:决策框架

是否放行训练型爬虫是商业决策而非技术决策,取决于你的内容资产定位。

如果你的商业模式依赖内容被阅读与引用(媒体、SaaS、专业服务、电商),放行带来的品牌曝光通常大于收益损失,建议放行检索型、按需决定训练型。

如果你的核心资产是独家数据或付费内容,且被模型吸收会直接替代你的产品,则封禁训练型是合理的,但仍应放行检索型——因为检索型会带来带来源链接的引用流量,这是净收益。

折中方案是按目录分级:公开的博客、指南、文档放行全部爬虫;付费墙内容与用户数据区对所有爬虫封禁。这种粒度化管理比全站一刀切更符合多数站点的实际利益。

把准入纳入 GEO 常态化监控

准入状态不是一次性配置,它会随 CDN 策略变更、WAF 规则更新和站点改版而失效。建议把它纳入季度巡检清单。

监控的重点指标有三项:检索型爬虫的 30 天请求量是否稳定、非 200 状态码占比是否异常升高、以及在 Broccoli AI GEO 的采样结果中自有域名作为引用来源出现的次数是否下滑。

其中第三项最敏感。Broccoli AI GEO 的技术准入维度会自动检测站点的可抓取性与 AI 爬虫可达性,把它作为常规监控项,可以在引用率下降之前就发现问题,而不是等到流量明显下滑才回溯。