我不想让AI在未经我允许的情况下学习我写的文章。这个愿望终于可以在没有任何技术障碍的情况下实现。 XServer 在日本首次开始提供一键阻止主要 AI 爬虫的功能。
2026年1月7日,X Server开始提供“AI爬虫拦截设置”功能。目标服务包括所有 XServer 计划、所有 XServer 商业计划和所有 XServer for WordPress 计划。此功能阻止对人工智能爬虫的访问,人工智能爬虫是爬行网站的自动程序,目的是收集训练数据以生成人工智能并生成答案。
可以从服务器面板一键配置,可以一次性阻止OpenAI(GPTBot等)、Google(Google-Extended等)、Anthropic(ClaudeBot等)等主流AI的访问。然而,不可能完全阻止所有AI的访问,搜索引擎爬虫(例如Googlebot)也不会被阻止。此外,一旦启用该功能,在生成人工智能答案时,网站将不再被作为信息源。
从: 使用生成的 AI 防止未经授权使用网站数据!开始提供“AI爬虫拦截设置”功能
【编辑部评论】
x服务器《AI爬虫拦截设置》该功能尚属国内托管公司首创。这一功能是对随着生成式人工智能迅速普及而日益增长的内容版权保护需求的极其及时的回应。
AI爬虫是一种以生成AI为目的的网站爬取的自动化程序,例如ChatGPT、Gemini、Claude等,以收集学习数据并获取信息来回答用户问题。其目的不同于传统的搜索引擎爬虫(Googlebot等)。使用内容来训练人工智能模型或引用信息来实时生成答案。
传统上,阻止AI爬虫需要发布者手动编辑robots.txt文件并单独指定每个AI爬虫的用户代理(识别信息)。然而,这种方法需要专业知识,这对许多网站运营商来说是一个很大的障碍。X Server的一个新功能是可以在服务器面板上一键屏蔽超过20种主要的AI爬虫,大大降低了技术门槛。
值得注意的是,该功能的设计目的是对搜索引擎爬虫没有影响。 Googlebot 和 Bingbot 可以像以前一样访问,因此您可以有选择地仅阻止 AI 学习爬虫,而不会对 SEO 措施产生负面影响。
然而,也有一些权衡。启用该功能将阻止您的网站被 ChatGPT 的搜索功能或 Perplexity 等 AI 搜索引擎引用为来源。这意味着失去新形式的流量获取机会。事实上,2024 年 5 月至 2025 年 5 月期间,AI 爬虫流量总体增长了 18%,尤其是 GPTBot 飙升了 305%。
从法律角度来看,2025年美国版权局就人工智能学习中版权的处理发布了重要意见。五月份发布的一份报告指出,人工智能学习是否属于合理使用是一个“具体情况具体分析”的决定,无法确定。今年 6 月,加州一家法院裁定,使用合法获得的书籍进行人工智能学习属于合理使用,具有“惊人的变革性”用途,但裁定禁止使用盗版书籍。
重要的是,通过 robots.txt 进行的访问控制不具有法律约束力。这只是一个“君子协定”,我们不能否认AI爬虫可能会忽略它。事实上,当 Anthropic 将“anthropic-ai”和“Claude-Web”这两个机器人集成到“ClaudeBot”中时,对尚未更新的网站的访问暂时不受限制。
通过将其作为 Xserver 等主要托管公司的标准功能提供,即使是没有技术知识的创作者和网站运营商现在也可以选择他们的内容是否将被人工智能使用。这可以称为生成人工智能时代内容权利保护的民主化。
然而,此举凸显了一个更大的问题。人工智能的发展需要大量数据,但其中大部分数据是由人类创造者生成的。人工智能公司和内容创作者之间关于数据使用权和补偿的争论未来可能会加剧。通过向内容所有者提供技术选项,XServer 的努力应该成为该讨论中的重要一步。
【术语解释】
人工智能爬虫
一个自动巡查网站并收集信息的程序,目的是收集训练数据以生成人工智能并生成答案。与传统的搜索引擎爬虫不同,它使用内容来训练人工智能模型,并实时引用信息来生成答案。
机器人.txt
放置在网站根目录中的文本文件,用于告诉搜索引擎和爬虫该网站是否可以访问。尽管它是自 1994 年以来一直使用的事实上的标准,但它不具有法律约束力,仅起到“君子协定”的作用。
用户代理
客户端在访问网站时发送的用于标识自身的字符串。就AI爬虫而言,它们具有“GPTBot”、“ClaudeBot”和“Google-Extended”等识别信息,并根据这些信息使用robots.txt进行控制。
谷歌机器人/Bingbot
Google 和 Bing 等搜索引擎使用的官方爬虫来索引网页。与人工智能爬虫不同,人工智能爬虫收集内容以在搜索结果中显示页面。
这
Search Engine Optimization的缩写,意思是搜索引擎优化。指优化网站内容和技术元素以使其在搜索结果中出现靠前的所有措施。
合理使用
美国版权法中的一个概念,允许未经版权所有者许可使用受版权保护的作品。在某些条件下允许出于教育、批评和新闻报道等目的使用。目前关于这一原则是否也适用于人工智能学习存在争议。
美国版权局
就版权注册和版权法提出政策建议的美国联邦政府机构。 2025年5月,我们发布了关于生成式人工智能学习版权处理的综合报告。
[参考链接]
X Server – AI爬虫拦截设置功能(外部)
Xserver提供的AI爬虫拦截功能官方手册。设置方法和阻止目标列表已发布。
困惑(外部)
Perplexity的官方网站,提供AI搜索引擎。开发了一项可以生成带有引文的答案的服务。
美国版权局——人工智能相关报告(外部)
美国版权局关于人工智能的官方页面。包含2025年5月发布的AI学习报告。
[参考文章]
人工智能机器人和机器人.txt |保罗·卡尔瓦诺(外部)
数据分析报告显示,2023 年 8 月,列出 GPTBot 的网站数量迅速增加至 125,000 个,几个月内达到 578,000 个网站。
从 Googlebot 到 GPTBot:2025 年谁会抓取您的网站 | Cloudflare 博客(外部)
据报道,从 2024 年 5 月到 2025 年 5 月的一年时间里,GPTBot 增长了 305%,Googlebot 增长了 96%。
版权局发布关于生成人工智能培训中合理使用的重要指南 |威利法(外部)
详细介绍 2025 年 5 月美国版权局报告。指出了对人工智能产品将蚕食人类创造市场的担忧。
合理使用的新视角:人工智能培训中的人择、元和版权 |礼德·史密斯(外部)
2025 年 6 月的一项裁决承认使用合法获得的书籍进行人工智能学习是合理使用,但否认盗版。
[编者后记]
你写的博客文章、你拍的照片可能会在你不知情的情况下被用于AI训练。您认为这是“对未来的投资”还是“未经授权的使用”? XServer 中的一项新功能为我们提供了回答这个问题的选择。
另一方面,你也可能因为没有被人工智能搜索引用而失去机会。这是一个没有正确答案的问题,但我认为至少能够选择是向前迈出的一大步。你会让人工智能学习你的内容吗?还是你想阻止它?
