AI 爬虫检测器

检测哪些 AI 爬虫(GPTBot、ClaudeBot、PerplexityBot 等)能访问你的网站,解析 robots.txt 规则,查看 Common Crawl 归档状态。

常见问题

什么是 AI 爬虫?

AI 爬虫是 AI 公司(OpenAI、Anthropic、Google 等)的机器人,访问你的网站为模型训练和 AI 搜索提供数据。GPTBot 为 ChatGPT 训练供料,OAI-SearchBot 为 ChatGPT 联网搜索供料。

我应该屏蔽 AI 爬虫吗?

取决于你的目标。想保护原创内容不被 AI 训练就屏蔽;希望网站被 AI 回答引用就放行——AI 搜索引擎正在成为真实流量来源。

为什么 GPTBot 访问返回 200,但我还是没被 ChatGPT 引用?

HTTP 200 只说明爬虫技术上能抓取你的页面。被 AI 回答引用还需要 AI 判断你的内容相关——这是另一个更慢的过程。

检测器如何测试爬虫?

我们抓取你网站的 robots.txt 读取权威规则,然后用每个爬虫的真实 User-Agent 探测首页。Common Crawl 状态通过公开索引 API 查询。

如果网站按 IP 而不是 User-Agent 拦截呢?

部分 WAF(如 Cloudflare Bot Management)会拦截数据中心 IP,无论 User-Agent 是什么。我们的探测从 Cloudflare 边缘发起,此类拦截可能显示为超时——结果标记为仅供参考,robots.txt 是权威信号。