AI 爬虫检测器
检测哪些 AI 爬虫(GPTBot、ClaudeBot、PerplexityBot 等)能访问你的网站,解析 robots.txt 规则,查看 Common Crawl 归档状态。
常见问题
什么是 AI 爬虫?
AI 爬虫是 AI 公司(OpenAI、Anthropic、Google 等)的机器人,访问你的网站为模型训练和 AI 搜索提供数据。GPTBot 为 ChatGPT 训练供料,OAI-SearchBot 为 ChatGPT 联网搜索供料。
我应该屏蔽 AI 爬虫吗?
取决于你的目标。想保护原创内容不被 AI 训练就屏蔽;希望网站被 AI 回答引用就放行——AI 搜索引擎正在成为真实流量来源。
为什么 GPTBot 访问返回 200,但我还是没被 ChatGPT 引用?
HTTP 200 只说明爬虫技术上能抓取你的页面。被 AI 回答引用还需要 AI 判断你的内容相关——这是另一个更慢的过程。
检测器如何测试爬虫?
我们抓取你网站的 robots.txt 读取权威规则,然后用每个爬虫的真实 User-Agent 探测首页。Common Crawl 状态通过公开索引 API 查询。
如果网站按 IP 而不是 User-Agent 拦截呢?
部分 WAF(如 Cloudflare Bot Management)会拦截数据中心 IP,无论 User-Agent 是什么。我们的探测从 Cloudflare 边缘发起,此类拦截可能显示为超时——结果标记为仅供参考,robots.txt 是权威信号。