跳到主内容

用 robots.txt 管理 AI 爬虫

训练、搜索、实时抓取三类 AI 爬虫的区别与处置策略;逐只放行/屏蔽的 robots.txt 配置示例,以及最常见的配置误区。

2026-02-10 · 约 7 分钟读完

先分类,再决定

AI 爬虫不是一类东西。按用途可分为三类,屏蔽任何一类之前都应先想清楚代价:

  • 训练语料类(GPTBot、ClaudeBot、CCBot 等):抓取内容用于模型训练。屏蔽后你的内容不进入后续模型的训练数据, 长期看降低被"记住"的概率,但不影响当下的联网问答。
  • 搜索索引类(OAI-SearchBot、PerplexityBot、Bytespider 等):为 AI 的联网检索建立索引。 屏蔽这一类等于主动放弃对应 AI 产品的引用流量,这是最常见的误伤。
  • 实时抓取类(ChatGPT-User、Claude-User 等):用户让 AI"看看这个链接"时实时触发, 代表真实用户的即时需求,一般不建议屏蔽。

完整的 39 只爬虫 UA 与分类见本站 「AI爬虫UA大全」,下面的配置示例只列代表性的几只。

三种典型策略

策略一:全部放行(默认)

User-agent: *
Allow: /

什么都不写即是放行。需要确认的是 CDN、WAF 或服务器防火墙没有按 UA 额外拦截—— 这类拦截发生在 robots.txt 生效之前,站长常常误以为"robots 没封就是通的"。

策略二:拒绝训练,保留 AI 搜索

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

这是内容型站点较常见的折中:内容不进入训练语料,但 OAI-SearchBot、PerplexityBot 等搜索爬虫仍可引用你,AI 问答里的曝光不受影响。

策略三:完全屏蔽某只爬虫

User-agent: Bytespider
Disallow: /

明确放弃该爬虫服务的全部产品流量。以 Bytespider 为例,屏蔽意味着放弃豆包与抖音搜索的引用。 除非有明确的合规或成本理由,不建议对搜索索引类爬虫使用此策略。

常见误区

  • 把 OAI-SearchBot 当训练爬虫屏蔽——它是 ChatGPT 联网搜索的索引爬虫,屏蔽后 ChatGPT 无法引用你的网站。
  • 在 robots.txt 里写了 Disallow,但 CDN 层(如 Cloudflare 的 Bot Fight Mode)早已按 UA 拦截,排查时应先看 CDN 日志。
  • 以为 robots.txt 是强制手段——它只是约定,恶意爬虫可以直接无视。真正的拦截要在防火墙或服务器层做。
  • 配置后从不验证。robots.txt 的解析有先后顺序、通配符等细节,配置与实际效果可能不一致。

验证分两步:用「AI收录综合查询」确认 robots.txt 规则解析结果符合预期;过一段时间再用 「AI爬虫日志分析」从服务器日志确认各爬虫的实际抓取行为。规则与日志一致,配置才算完成。

本站检测项与本文方法保持一致,可用AI收录综合查询验证配置效果。各项结果仅供分析参考。

其他指南