免费工具

哪些 AI 爬虫
读到你的网站?

把 robots.txt 粘贴到下面,逐个爬虫看你放行了谁。来要页面的爬虫分三类,屏蔽哪一类,代价都不一样。

三类爬虫
训练

它们抓页面是为了训练下一代模型。屏蔽之后你的内容不会进训练语料,但也不会让你从 AI 回答里消失。

搜索

为 AI 搜索回答建立引用索引。屏蔽它,你会从这些回答里消失。

助手

在用户提问的那一刻实时抓取页面。屏蔽它,助手无法实时读到你。

检查你的 robots.txt

判定遵循 robots.txt 的分组匹配、以站点根路径为准:爬虫服从点名它的最具体分组,没被点名则落到 * 分组。robots.txt 是一份请求,不是一堵墙,不过主流厂商都会遵守。

爬虫目录

下面这些是对 AI 可见度真正要紧的爬虫。这张表和我们自己的流量监测共用一份,我们每天都在读它的产出,所以一直是新的。

User agent厂商类型
ChatGPT-UserOpenAI助手
OAI-SearchBotOpenAI搜索
GPTBotOpenAI训练
Claude-UserAnthropic助手
Claude-SearchBotAnthropic搜索
ClaudeBotAnthropic训练
anthropic-aiAnthropic训练
Perplexity-UserPerplexity助手
PerplexityBotPerplexity搜索
MistralAI-UserMistral助手
DuckAssistBotDuckDuckGo助手
Google-ExtendedGoogle训练
GoogleOtherGoogle训练
Googlebot · 它同时也是传统网页搜索的爬虫,屏蔽之后普通搜索流量也会没Google搜索
bingbot · 它同时也是传统网页搜索的爬虫,屏蔽之后普通搜索流量也会没Microsoft搜索
Applebot-ExtendedApple训练
ApplebotApple搜索
AmazonbotAmazon训练
meta-externalagentMeta训练
FacebookBotMeta训练
BytespiderByteDance训练
CCBotCommon Crawl训练
cohere-aiCohere训练
YouBotYou.com搜索
DiffbotDiffbot训练
TimpibotTimpi训练
omgiliWebz.io训练
ImagesiftBotImagesift训练
AgentTrustBotAgentTrust搜索
常见问题
看你卖什么。屏蔽 GPTBot 只是让页面不进 OpenAI 的训练语料,不会让你从 ChatGPT 的回答里消失,那些回答走的是 OAI-SearchBot 和 ChatGPT-User。如果「买家问 AI 时能找到你」对生意重要,训练类想屏蔽就屏蔽,但搜索类和助手类要三思。
一个厂商,三份工。GPTBot 采集训练数据,OAI-SearchBot 建 ChatGPT 引用的搜索索引,ChatGPT-User 在用户提问时实时抓取页面。Anthropic 也是同样的三件套(ClaudeBot、Claude-SearchBot、Claude-User)。robots.txt 可以对每一个区别对待,这正是这个页面存在的原因。
来自运营,不是来自哪篇博客。它就是我们自己流量监测背后的分类表,表上每个爬虫都在真实服务器日志里出现并核实过;日志里出现认不出的新 agent,名单就会长。
它是一份公开的请求,遵守是自愿的,不过 OpenAI、Anthropic、Google、Apple 这些主流厂商都有文档承诺,也确实遵守。它拦不住的是从不自报家门的抓取器,那是防火墙的事,不是 robots.txt 的事。