AI 爬虫要不要放行?robots.txt 怎么配

想被 AI 搜索引用,第一个前提是内容能被抓到。但“AI 爬虫”不是一个东西:同一家公司通常有训练用、搜索用、用户触发用等不同的爬虫,robots.txt 可以分别控制。配置之前先分清它们,免得一刀切把自己挡在 AI 搜索之外。

先说边界

下面关于各爬虫用途的说明来自厂商自己的文档,随时可能变化,请以官方页面为准。本文不声称任何具体 AI 产品(包括 DeepSeek、豆包、千问)访问过本站,因为我没有这样的证据。

常见的 AI 爬虫分别做什么

只列出我核对过厂商官方说明的几个。

爬虫用途robots.txt 与影响
OAI-SearchBot(OpenAI)让网站出现在 ChatGPT 搜索结果里官方说明:不允许它抓取的站点,不会出现在 ChatGPT 搜索答案中。
GPTBot(OpenAI)抓取内容用于训练生成式 AI 基础模型禁止它表示不希望内容被用于训练;与 ChatGPT 搜索是否展示你是两件事。
ChatGPT-User(OpenAI)用户在 ChatGPT 里要求访问某个页面时代为访问官方说明:由用户发起,robots.txt 规则可能不适用。
ClaudeBot(Anthropic)收集可能用于模型训练的网页内容可用 robots.txt 单独禁止。
Claude-User(Anthropic)用户在 Claude 里提问需要联网时,代为获取页面禁用后,你的站点无法通过 Claude 的联网搜索被访问。
Claude-SearchBot(Anthropic)浏览网页以提升 Claude 搜索结果的质量禁用后,不会被用于优化 Claude 搜索。

官方说明:OpenAI 爬虫文档、Anthropic:ClaudeBot 是什么。国内平台(DeepSeek、豆包、千问等)我没有找到可核实的公开爬虫说明,所以这里不写。

robots.txt 怎么写

最简单的做法是全部放行。这是本站目前的写法:

# 允许所有爬虫访问全站(本站目前的写法)
User-agent: *
Allow: /

Sitemap: https://www.zhangbaiyang.com/sitemap.xml

如果你不希望内容被用来训练模型,但仍然希望被 AI 搜索展示,可以只禁训练用的爬虫,不写搜索用爬虫的规则:

# 示例:不希望内容被用于训练,但仍希望被 AI 搜索引用
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

# OAI-SearchBot、Claude-SearchBot 不写规则 = 不限制

这只是写法示例,不是建议你必须禁止什么。是否允许训练使用你的内容,是你自己的决定。

四个常见错误

  1. 把所有 AI 爬虫一起禁掉。训练用的爬虫和搜索用的爬虫是分开的。想要被 AI 搜索引用,却把搜索爬虫一起禁掉,等于主动退出了。先想清楚你要什么:不想被用于训练,和想被 AI 搜索展示,是两个独立的决定。
  2. 以为 robots.txt 能保证什么。robots.txt 是约定,不是强制。守规矩的爬虫会遵守,但它既不能保证某个平台一定抓取你,也不能保证某个平台一定不抓。
  3. 页面对爬虫返回空内容或拦截页。有些站点的防火墙、CDN 或“防爬”设置会对陌生的 User-Agent 返回 403、验证页或空壳页面。robots.txt 写得再对,页面抓不到也没有意义。
  4. 内容靠脚本渲染。如果正文要执行 JavaScript 才出现,部分爬虫看到的会是空页面。核心服务、案例和联系方式最好直接在 HTML 里。

怎么自己验证

用不同的 User-Agent 请求你的首页,看状态码和内容是否正常。把下面的域名换成你自己的:

curl -s -o /dev/null -w "%{http_code}\n" -A "GPTBot" https://你的域名/
curl -s -o /dev/null -w "%{http_code}\n" -A "ClaudeBot" https://你的域名/
curl -s -o /dev/null -w "%{http_code}\n" -A "Baiduspider" https://你的域名/

2026-10-04,我用 Googlebot、Bingbot、Baiduspider、GPTBot、ClaudeBot、PerplexityBot、Bytespider、360 搜索和搜狗的 User-Agent 请求了本站首页,都返回 200,页面内容一致。这只能说明本站没有拦截这些请求,不能说明这些爬虫真的来抓过。我也没有分析过服务器的访问日志,所以目前无法回答“哪些 AI 爬虫实际来过”。

检查之后,还要确认页面真的被收录:到 Google Search Console、Bing Webmaster Tools、百度搜索资源平台提交 sitemap,并看收录报告。

相关阅读:什么是 GEO · llms.txt 是什么,要不要做 · AI 搜索自查清单