先分类,再决定
AI 爬虫不是一类东西。按用途可分为三类,屏蔽任何一类之前都应先想清楚代价:
- 训练语料类(GPTBot、ClaudeBot、CCBot 等):抓取内容用于模型训练。屏蔽后你的内容不进入后续模型的训练数据, 长期看降低被"记住"的概率,但不影响当下的联网问答。
- 搜索索引类(OAI-SearchBot、PerplexityBot、Bytespider 等):为 AI 的联网检索建立索引。 屏蔽这一类等于主动放弃对应 AI 产品的引用流量,这是最常见的误伤。
- 实时抓取类(ChatGPT-User、Claude-User 等):用户让 AI"看看这个链接"时实时触发, 代表真实用户的即时需求,一般不建议屏蔽。
完整的 39 只爬虫 UA 与分类见本站 「AI爬虫UA大全」,下面的配置示例只列代表性的几只。
三种典型策略
策略一:全部放行(默认)
User-agent: * Allow: /
什么都不写即是放行。需要确认的是 CDN、WAF 或服务器防火墙没有按 UA 额外拦截—— 这类拦截发生在 robots.txt 生效之前,站长常常误以为"robots 没封就是通的"。
策略二:拒绝训练,保留 AI 搜索
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: CCBot Disallow: / User-agent: Google-Extended Disallow: /
这是内容型站点较常见的折中:内容不进入训练语料,但 OAI-SearchBot、PerplexityBot 等搜索爬虫仍可引用你,AI 问答里的曝光不受影响。
策略三:完全屏蔽某只爬虫
User-agent: Bytespider Disallow: /
明确放弃该爬虫服务的全部产品流量。以 Bytespider 为例,屏蔽意味着放弃豆包与抖音搜索的引用。 除非有明确的合规或成本理由,不建议对搜索索引类爬虫使用此策略。
常见误区
- 把 OAI-SearchBot 当训练爬虫屏蔽——它是 ChatGPT 联网搜索的索引爬虫,屏蔽后 ChatGPT 无法引用你的网站。
- 在 robots.txt 里写了 Disallow,但 CDN 层(如 Cloudflare 的 Bot Fight Mode)早已按 UA 拦截,排查时应先看 CDN 日志。
- 以为 robots.txt 是强制手段——它只是约定,恶意爬虫可以直接无视。真正的拦截要在防火墙或服务器层做。
- 配置后从不验证。robots.txt 的解析有先后顺序、通配符等细节,配置与实际效果可能不一致。
验证分两步:用「AI收录综合查询」确认 robots.txt 规则解析结果符合预期;过一段时间再用 「AI爬虫日志分析」从服务器日志确认各爬虫的实际抓取行为。规则与日志一致,配置才算完成。