Anthropic官方解释了三种类型的爬虫 - 各种克劳德机器人之间的差异以及如何阻止它们

Anthropic 使用三种类型的机器人从网络收集数据:ClaudeBot、Claude-User 和 Claude-SearchBot。 ClaudeBot 旨在收集用于训练 AI 模型的数据,而 Claude-User 是一个代理,当用户向 Claude 提出问题时,它会访问该网站。 Claude-SearchBot 抓取网络的目的是提高用户搜索结果的质量。

网站所有者可以通过编辑 robots.txt 文件来限制或阻止单个机器人的访问。有效的拦截方法是在robots.txt中添加描述“User-agent: ClaudeBot / Disallow: /”,通过IP地址拦截并不能保证持续有效。 Anthropic 目前并未透露其 IP 范围,但表示未来可能会发生变化。联系我们:[email protected]

从: Anthropic 是否从网络上抓取数据?网站所有者如何阻止抓取工具? |克劳德帮助中心

【编辑部评论】

Anthropic此次发布和更新的是其网络爬虫的官方文档。这是一个重要举措,不仅仅是简单地解释技术规范,而是从根本上重新考虑人工智能公司和网站所有者之间的关系。

这份文件受到关注的原因是2024年至2025年将迅速蔓延的“AI爬虫区块”趋势。根据 BuzzStream 的一项研究(据《搜索引擎杂志》报道),79% 的热门新闻网站屏蔽至少一个人工智能训练机器人,71% 还屏蔽检索和搜索机器人。也就是说,很多网站都采取了“屏蔽AI爬虫”的策略。

然而,Anthropic 现在通过明确区分和解释这三种类型的机器人,利用了这种“批量阻止”策略中的盲点。阻止 ClaudeBot 不会阻止 Claude-User 或 Claude-SearchBot,相反,阻止 Claude-SearchBot 可能会阻止您的网站显示在 Claude 的搜索结果中。我们已经进入了一个时代,网站所有者必须就阻止什么和允许什么做出更具战略性的决策。

一项值得注意的统计数据:截至 2025 年 7 月,Anthropic 的 ClaudeBot 为每个发回网站的访问者抓取了 38,065 个页面。六个月前,这一比例为286,930:1,尽管数字正在改善,但仍然存在很大的不平衡。这个数字是爬虫的代表人类消费内容” 这给人一种清晰的规模感,网站所有者自然会产生担忧。

另一方面Anthropic 通过披露详细的数据收集方法来响应加利福尼亚州的 AB 2013(培训数据透明度法案)。本次文件更新与这一监管趋势不无关系,通过明确表示“符合行业标准”,可见该公司正在努力降低法律风险。

从积极的一面来看,这种隔离机器人和提高透明度的方法是为网站所有者提供更多控制权的一个进步。现在可以设置诸如“我不希望它用于培训,但我希望能够回答用户问题”之类的设置,内容提供商和 AI 服务的共存模型正在成为现实。

一个不容忽视的潜在风险是robots.txt只不过是一个“请求”。尽管Anthropic已声明其合规性,但它对恶意第三方机器人无效,并且不具有法律约束力。还事实上,通过 IP 地址进行阻止显然不起作用,这意味着网站所有者的选择较少。

从长远来看,如今人工智能正在成为搜索和获取信息的主要渠道,“你的产品是否会出现在人工智能搜索中”与SEO同等重要,甚至更重要。有一天,屏蔽 Claude-SearchBot 可能意味着从 Google 搜索索引中删除。网络内容本身的分发结构正在悄然但确实发生着变化。

【术语解释】

机器人.txt
位于 Web 服务器根目录中的文本文件。这是一种行业标准机制,告诉爬虫(机器人)他们可以或不可以访问哪些页面。它不具有法律约束力,仅起到向爬虫发出“请求”的作用。

用户代理
在 robots.txt 中用于识别爬网程序的名称。通过编写类似“User-agent: ClaudeBot”的内容,您可以仅将规则应用于特定的机器人。如果你写“User-agent: *”,它将为所有爬虫设置。

不允许
使用robots.txt中写入的指令指定禁止爬虫访问的路径。您可以通过写入“Disallow:/”来拒绝对整个站点的访问。

[参考链接]

人择(外部)
2021年成立的美国AI安全研究公司Public Benefit Corporation,开发并提供Claude AI。

克劳德(claude.ai)(外部)
Anthropic的AI助手。支持广泛的任务,例如问题解决、数据分析和编码。可在 Web、应用程序和 API 上使用。

Claude 帮助中心:有关爬虫的页面(外部)
官方支持页面解释了 Anthropic 三种爬虫的作用以及如何使用 robots.txt 阻止它们。

[参考文章]

Anthropic 阐明了 Claude 机器人如何抓取网站以及如何阻止它们(外部)
一篇新闻文章指出,Anthropic 明确了三种爬虫程序的作用,并解释了如何阻止每种爬虫程序及其影响。

2026 年如何管理 AI 爬虫对您网站的访问(外部)
一篇技术文章,通过引用 Cloudflare 的数值数据来解释 AI 爬虫的规模,例如 ClaudeBot 的爬行比率(38,065:1)。

Anthropic 的 Claude 机器人使 Robots.txt 决策更加细化(外部)
一篇解释性文章,引用 BuzzStream 调查数据(79% 和 71% 的顶级新闻网站屏蔽机器人),讨论了通过分离机器人的“批量屏蔽”策略的盲点以及网站所有者应如何应对。

Anthropic 阐明了其三个网络爬虫的作用以及如何阻止它们(外部)
每个机器人块的实际影响都通过代码示例进行了总结。一篇文章,以通俗易懂的方式解释了bot分离的结构性问题。

[编者后记]

您最后一次查看网站的 robots.txt 是什么时候?

Robots.txt曾经是Googlebot的指令。但现在谷歌并不是唯一可以写信的人。 ClaudeBot、GPTBot、PerplexityBot……人工智能将陆续抓取网络、阅读内容、学习并将其转化为用户答案的​​时代已经开始。

乍一看,Anthropic 对三种类型机器人的明确解释只是技术更新。然而,我们认为,其本质是每个网站所有者都面临着这样的问题:“谁控制人工智能和网络之间的关系,以及如何控制?”

“我不希望它用于训练,但我希望用户找到它”“我希望它出现在搜索中,但我不希望它被用作训练数据”——如此详细的意图最终可以通过单个 robots.txt 文件实现。对于内容提供商来说,这是一小步,但却是一大步。

另一方面,robots.txt只是一个“君子协定”。即使像Anthropic这样诚实的公司声明合规,也不是所有的爬虫都会有同样的态度。未来的网络运营商将需要有能力独立思考如何保护和分发自己的内容,而不仅仅是依赖规则。

作为传播内容的媒体撰稿人,我不认为这个问题是别人的问题。我们将继续与大家一起关注AI与内容的关系将如何变化。