AI 爬虫检测:GPTBot、ClaudeBot 能不能抓你的网站
输入域名或粘贴网站的 robots.txt,工具会按 RFC 9309 的规则判断各个 AI 爬虫和搜索引擎爬虫能否抓取你指定的路径,并显示命中的是哪一行规则。
为什么要分开看 AI 搜索和 AI 训练
很多网站在 robots.txt 里禁止 AI 爬虫,是为了不让内容被拿去训练模型。但 AI 公司通常用不同的爬虫做不同的事:
- AI 搜索爬虫(如 OAI-SearchBot、Claude-SearchBot、PerplexityBot)决定你的页面能不能出现在 ChatGPT、Claude、Perplexity 的搜索回答里,并被标注为引用来源。
- AI 训练爬虫(如 GPTBot、ClaudeBot、CCBot)收集的内容用于训练模型,不直接带来引用和点击。
- Google-Extended 和 Applebot-Extended 只是控制令牌,不是独立的爬虫。禁止 Google-Extended 不影响 Google 搜索收录,也不影响 AI Overviews,后者由 Googlebot 决定。
如果目标是让 AI 搜索引用你的内容,同时不提供训练数据,就应该放行搜索类爬虫,只禁止训练类爬虫。工具的「加载示例」就是这样一份配置。
匹配规则
工具按 RFC 9309 和 Google 的实现判断:
- 爬虫先找
User-agent与自己名称一致的分组(不区分大小写);找不到时使用User-agent: *分组。多个分组都匹配时,规则合并。 - 在分组内,路径匹配最长的规则生效;
Allow和Disallow一样长时,Allow优先。 *匹配任意字符,$表示路径结尾。Disallow:后面为空表示不禁止任何路径。/robots.txt本身总是允许抓取。
给老手:容易踩的几个细节
- 一个爬虫一旦有了自己的分组,就不再读取
User-agent: *分组的规则。例如为 GPTBot 单独写了Disallow: /private/,*分组里的Disallow: /cart对 GPTBot 就不生效了。 - 连续的多行
User-agent属于同一个分组,共用下面的规则。 Crawl-delay不被 Google 支持,Bing 和 Yandex 支持。- ChatGPT-User、Perplexity-User 这类由用户提问触发的访问,运营方在文档中说明可能不遵守 robots.txt。
- robots.txt 只控制抓取,不控制索引。已被禁止抓取的网址如果有外链,仍可能以无摘要的形式出现在搜索结果里。
常见问题
为什么工具判断允许,但 AI 还是抓不到我的网站?
robots.txt 只是声明。Cloudflare 等 CDN 的「屏蔽 AI 爬虫」开关、WAF 规则、服务器按 User-Agent 拦截,都会在 robots.txt 之外直接拒绝请求。另外,大多数 AI 爬虫不执行 JavaScript,只靠客户端渲染的内容对它们来说是空白页。
输入域名时,工具是怎么获取 robots.txt 的?
浏览器的同源策略不允许网页里的脚本读取其他网站,所以由本站服务器代为请求 https://域名/robots.txt,只返回这个文件的内容。获取有频率限制(每个 IP 每小时 30 次),同一网站 10 分钟内重复检查会使用缓存。如果网站对服务器请求和浏览器请求返回不同的内容,也可以手动打开 robots.txt 复制粘贴。
列表里的爬虫名称以哪里为准?
以各公司公开的爬虫文档为准。AI 公司会不定期新增或更名爬虫,本工具会随之更新;更新日期见页面顶部。