robots.txt 在线生成
对 39 只主流 AI 爬虫逐只设置放行或屏蔽,实时生成 robots.txt 内容。生成的文件需放置于网站根目录(如 https://你的域名/robots.txt)后生效。
快捷策略:
OpenAI
- 放行GPTBot模型训练ChatGPT(训练数据)
- 放行OAI-SearchBot搜索索引ChatGPT 联网搜索
- 放行ChatGPT-User实时抓取ChatGPT 实时浏览
- 放行ChatGPT Agent实时抓取ChatGPT Agent 模式
Anthropic
- 放行ClaudeBot模型训练Claude(训练数据)
- 放行Claude-User实时抓取Claude 实时浏览
- 放行Claude-SearchBot搜索索引Claude 联网搜索
Perplexity
- 放行PerplexityBot搜索索引Perplexity AI 搜索
- 放行Perplexity-User实时抓取Perplexity 实时浏览
字节跳动
- 放行Bytespider搜索索引豆包 / 抖音搜索 / 头条搜索
DeepSeek
- 放行DeepSeekBot模型训练DeepSeek(训练数据)
月之暗面
- 放行KimiBot模型训练Kimi(训练数据)
- 放行Kimi-SearchBot搜索索引Kimi 联网搜索
- 放行Kimi-User实时抓取Kimi 实时浏览
智谱
- 放行ChatGLM-Spider模型训练智谱清言 / ChatGLM(语料采集)
阿里
- 放行TongyiBot搜索索引通义千问 / 夸克 AI
华为
- 放行PanguBot模型训练盘古大模型(训练数据)
- 放行PetalBot搜索索引花瓣搜索 / 小艺助手
百度
- 放行Baiduspider搜索索引百度搜索 / 文心一言
- 放行YiyanBot搜索索引文心一言
微软
- 放行Bingbot搜索索引Bing / Copilot / ChatGPT 搜索
Google
- 放行Googlebot搜索索引Google 搜索 / AI Overviews / Gemini
- 放行Google-Extended训练控制Gemini(训练控制开关)
- 放行Google-CloudVertexBot模型训练Vertex AI(企业模型定制)
- 放行GoogleOther模型训练Google 内部研发用途
Meta
- 放行Meta-ExternalAgent模型训练Meta AI / Llama(训练数据)
- 放行Meta-ExternalFetcher实时抓取Meta AI 实时抓取
Apple
- 放行Applebot-Extended训练控制Apple Intelligence(训练控制开关)
Common Crawl
- 放行CCBot训练语料多家大模型训练语料库
Amazon
- 放行Amazonbot搜索索引Alexa AI
- 放行Amzn-User实时抓取Alexa / Rufus 实时问答
DuckDuckGo
- 放行DuckAssistBot搜索索引Duck.ai / DuckAssist
Cohere
- 放行Cohere Crawler模型训练Cohere 模型训练
TikTok
- 放行TikTokSpider搜索索引TikTok 搜索与 AI 功能
Mistral
- 放行MistralAI-User实时抓取Le Chat 实时浏览
Manus(蝴蝶效应)
- 放行Manus-User实时抓取Manus Agent 实时浏览
Exa
- 放行ExaBot搜索索引Exa AI 搜索 API
Tavily
- 放行TavilyBot搜索索引Tavily 搜索 API
Linkup
- 放行LinkupBot搜索索引Linkup 搜索 API
生成的 robots.txt
封禁 0 / 39# robots.txt · AI 爬虫访问规则 # 由 QVSO 在线生成 # 策略:封禁 0 只 / 共 39 只 AI 爬虫 # 当前配置为放行全部 AI 爬虫( robots.txt 默认即放行,以下内容可留空 ) User-agent: * Allow: /
使用方法:将内容保存为 robots.txt 并上传至网站根目录,使 https://你的域名/robots.txt 可访问即可生效;部署后可切到「校验已有文件」确认 39 只 AI 爬虫的实际放行/屏蔽状态。 robots.txt 为君子协定(声明层),服务器是否真的执行拦截,可用AI 爬虫模拟访问验证执行层。
工具简介
robots.txt 是站点根目录下的爬虫访问约定文件,AI 爬虫与搜索引擎爬虫均应先读取该文件再决定抓取范围。 本工具收录 39 只主流 AI 爬虫的 UA token,按运营方分组,可逐只切换放行或屏蔽;默认提供「全部放行」 「仅屏蔽训练类」「全部屏蔽」三种常用策略。需要说明:robots.txt 属于君子协定,主流 AI 厂商会遵守, 但无法约束不遵守协定的抓取行为;如需强制拦截,应在 CDN 或防火墙层面按 UA 或 IP 段处理。 生成的文件内容可直接复制或下载,支持附加 Sitemap 指令,覆盖站点根目录的同名文件后即时生效。 「校验已有文件」输入域名即可在线解析站点现有 robots.txt,按与完整检测报告一致的口径输出 39 只爬虫的 放行/屏蔽矩阵与命中规则。各项结果仅供分析参考。