AI爬虫UA大全
AI 爬虫分三类:搜索索引类(屏蔽等于放弃 AI 搜索流量,慎封)、实时抓取类、训练语料类(可按意愿放行或屏蔽)。在 robots.txt 中用对应 UA token 即可逐只控制。
| 爬虫 / UA Token | 运营方 | 用途 | 服务的 AI 产品 | 屏蔽影响 |
|---|---|---|---|---|
GPTBot 官方文档 | OpenAI | 模型训练 | ChatGPT(训练数据) | 屏蔽后你的内容不会进入 ChatGPT 的训练语料,长期看降低被“记住”的概率 |
OAI-SearchBot 官方文档 | OpenAI | 搜索索引 | ChatGPT 联网搜索 | 直接影响 ChatGPT 联网问答时能否检索并引用你的网站 |
ChatGPT-User 官方文档 | OpenAI | 实时抓取 | ChatGPT 实时浏览 | 用户向 ChatGPT 提问时实时访问你的页面,屏蔽后无法被即时引用 |
ChatGPT Agent 官方文档 | OpenAI | 实时抓取 | ChatGPT Agent 模式 | Agent 模式下 ChatGPT 自主浏览网页完成任务,屏蔽后无法被 Agent 场景引用 |
ClaudeBot 官方文档 | Anthropic | 模型训练 | Claude(训练数据) | 屏蔽后内容不进入 Claude 训练语料 |
Claude-User 官方文档 | Anthropic | 实时抓取 | Claude 实时浏览 | 影响 Claude 对话中实时抓取你的页面 |
Claude-SearchBot 官方文档 | Anthropic | 搜索索引 | Claude 联网搜索 | 影响 Claude 联网检索时你的网站能否被引用 |
PerplexityBot 官方文档 | Perplexity | 搜索索引 | Perplexity AI 搜索 | Perplexity 是纯 AI 搜索引擎,屏蔽等于直接放弃这个入口 |
Perplexity-User 官方文档 | Perplexity | 实时抓取 | Perplexity 实时浏览 | 影响 Perplexity 实时访问你的页面 |
Bytespider | 字节跳动 | 搜索索引 | 豆包 / 抖音搜索 / 头条搜索 | 字节系 AI(豆包等)联网能力的底层爬虫,中文站长最关键的一只 |
DeepSeekBot | DeepSeek | 模型训练 | DeepSeek(训练数据) | 屏蔽后内容不进入 DeepSeek 训练语料;DeepSeek 联网问答主要依赖搜索引擎索引 |
KimiBot | 月之暗面 | 模型训练 | Kimi(训练数据) | 屏蔽后内容不进入 Kimi 训练语料 |
Kimi-SearchBot | 月之暗面 | 搜索索引 | Kimi 联网搜索 | 影响 Kimi 联网问答时你的网站能否被检索并引用 |
Kimi-User | 月之暗面 | 实时抓取 | Kimi 实时浏览 | 用户向 Kimi 提问时实时访问你的页面,屏蔽后无法被即时引用 |
ChatGLM-Spider | 智谱 | 模型训练 | 智谱清言 / ChatGLM(语料采集) | 智谱系语料采集爬虫,屏蔽影响清言等产品对站点的语料覆盖 |
TongyiBot | 阿里 | 搜索索引 | 通义千问 / 夸克 AI | 通义千问与夸克 AI 问答的内容获取爬虫,屏蔽后难以被阿里系 AI 引用 |
PanguBot | 华为 | 模型训练 | 盘古大模型(训练数据) | 屏蔽后内容不进入华为盘古训练语料 |
Baiduspider 官方文档 | 百度 | 搜索索引 | 百度搜索 / 文心一言 | 百度索引同时支撑文心一言的联网检索 |
YiyanBot | 百度 | 搜索索引 | 文心一言 | 文心一言问答的内容获取爬虫;百度主索引仍由 Baiduspider 支撑 |
Bingbot 官方文档 | 微软 | 搜索索引 | Bing / Copilot / ChatGPT 搜索 | ChatGPT 与 Copilot 的联网检索依赖 Bing 索引,屏蔽后果远超丢失 Bing 流量 |
Googlebot 官方文档 | 搜索索引 | Google 搜索 / AI Overviews / Gemini | Google AI Overviews 的引用来源基本出自搜索索引 | |
Google-Extended 官方文档 | 训练控制 | Gemini(训练控制开关) | 不是爬虫,是 robots.txt 里的控制令牌:Disallow 它表示不同意内容用于 Gemini 训练 | |
Google-CloudVertexBot | 模型训练 | Vertex AI(企业模型定制) | 企业客户在 Vertex AI 上构建模型时的采集爬虫,不影响 Gemini 面向消费者的引用 | |
GoogleOther | 模型训练 | Google 内部研发用途 | Google 未指明具体产品的兜底爬虫,抓取通常与 AI 研发相关 | |
Meta-ExternalAgent | Meta | 模型训练 | Meta AI / Llama(训练数据) | 屏蔽后内容不进入 Meta 系模型训练语料 |
Meta-ExternalFetcher | Meta | 实时抓取 | Meta AI 实时抓取 | Meta AI 回答用户问题时实时获取页面内容,屏蔽后无法被即时引用 |
Applebot-Extended | Apple | 训练控制 | Apple Intelligence(训练控制开关) | robots.txt 控制令牌:Disallow 表示不同意内容用于苹果 AI 训练 |
CCBot 官方文档 | Common Crawl | 训练语料 | 多家大模型训练语料库 | Common Crawl 是大量模型的基础语料,屏蔽影响面很广 |
Amazonbot | Amazon | 搜索索引 | Alexa AI | 影响 Alexa/亚马逊系 AI 的引用 |
DuckAssistBot | DuckDuckGo | 搜索索引 | Duck.ai / DuckAssist | 影响 DuckDuckGo 的 AI 问答引用 |
Cohere Crawler | Cohere | 模型训练 | Cohere 模型训练 | 屏蔽后内容不进入 Cohere 训练语料 |
TikTokSpider | TikTok | 搜索索引 | TikTok 搜索与 AI 功能 | 影响 TikTok 站内搜索与 AI 摘要 |
MistralAI-User | Mistral | 实时抓取 | Le Chat 实时浏览 | Le Chat 回答用户问题时实时访问你的页面 |
Amzn-User | Amazon | 实时抓取 | Alexa / Rufus 实时问答 | Alexa 与亚马逊购物助手 Rufus 回答用户问题时实时获取页面 |
PetalBot | 华为 | 搜索索引 | 花瓣搜索 / 小艺助手 | 影响华为花瓣搜索与小艺 AI 助手的收录与引用 |
Manus-User | Manus(蝴蝶效应) | 实时抓取 | Manus Agent 实时浏览 | Manus 执行 Agent 任务时实时访问你的页面 |
ExaBot | Exa | 搜索索引 | Exa AI 搜索 API | Exa 是大量 AI 应用的检索层,屏蔽会影响经其 API 引用你的各类 AI 产品 |
TavilyBot | Tavily | 搜索索引 | Tavily 搜索 API | Tavily 为 AI Agent 提供检索 API,屏蔽影响经其引用你的下游 AI 应用 |
LinkupBot | Linkup | 搜索索引 | Linkup 搜索 API | Linkup 为 AI 应用提供联网检索,屏蔽影响其下游 AI 产品对你的引用 |
常见 robots.txt 配置
按策略生成完整 robots.txt(含逐只开关与在线校验)→放行所有 AI 爬虫
User-agent: * Allow: /
默认状态即放行,无需额外配置;前提是 CDN/防火墙没有按 UA 额外拦截
只拒绝训练,保留 AI 搜索
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: DeepSeekBot Disallow: / User-agent: KimiBot Disallow: / User-agent: ChatGLM-Spider Disallow: / User-agent: PanguBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Google-CloudVertexBot Disallow: / User-agent: GoogleOther Disallow: / User-agent: Meta-ExternalAgent Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: cohere-training-data-crawler Disallow: /
以上为当前全部 13 只训练语料类爬虫(随名单扩充自动更新)。内容不进入训练语料,但 OAI-SearchBot 等搜索爬虫仍可引用你
完全屏蔽某只爬虫
User-agent: Bytespider Disallow: /
注意:屏蔽 Bytespider 意味着主动放弃豆包与抖音搜索流量
资料说明
本表收录 39 只主流 AI 爬虫的 UA token、运营方、用途分类与屏蔽影响,数据来源于各平台公开文档,与「AI收录综合查询」的 robots.txt 解析规则保持同步;逐只放行/屏蔽状态可用在线校验实测。用途分为三类:搜索索引类爬虫直接决定网站能否出现在对应 AI 的联网检索结果中;实时抓取类在用户让 AI"阅读某个链接"时触发;训练语料类只影响内容是否进入后续模型的训练数据。
各平台爬虫策略会不定期调整,表中信息以官方文档为准。