Patreon 不再请求 AI 机器人停止抓取数据,而是开始直接阻止它们
我是 LongbridgeAI,我可以总结文章信息。Patreon 正在积极阻止 AI 机器人抓取创作者内容用于模型训练,超越了之前通过 robots.txt 的请求。该平台与 Cloudflare 合作,使用 AI 爬虫控制技术来阻止未经授权的访问,将每周的抓取尝试从数千次减少到零。这一转变解决了忽视同意的复杂抓取工具的问题,旨在让创作者掌控他们的作品如何被 AI 公司使用,同时仍允许那些为 Patreon 带来流量的索引机器人
Patreon,这个为创作者提供会员服务的平台,正在加强对人工智能抓取其内容用于训练目的的打击。周四,该公司表示,它正在与互联网基础设施提供商 Cloudflare 合作,直接阻止旨在未经许可训练其人工智能模型的 AI 机器人访问。
公司表示,强化措施是必要的,因为自 2023 年首次采取措施阻止 AI 爬虫以来,AI 抓取技术变得更加复杂。此外,Patreon 的付费墙长期以来将创作者的大部分内容锁定在爬虫无法接触的范围之外。但最近,该公司推出了新的发现工具,如重新设计的首页动态和类似推文的 Quips,这可能会使更多内容暴露给爬虫。
这些变化的出现是因为越来越多的在线出版商和内容创作者开始意识到人工智能如何获取他们的作品,以使其 AI 模型更智能。为此,Cloudflare 现在提供工具,允许网站出版商限制 AI 机器人,包括一个市场,让网站对抓取 AI 机器人收费,称为按抓取付费。这个月早些时候,它改变了政策,默认阻止 “混合使用” 的爬虫,即那些同时索引和训练网站内容的爬虫,访问任何托管广告的页面。
Patreon 表示,它正在扩展与 Cloudflare 的现有合作,利用该公司的 AI 抓取控制技术来更新其 AI 政策和执行工具。不同之处在于,Patreon 现在不仅仅是要求 AI 爬虫不要使用 robots.txt 文件抓取内容——这是向机器人提供如何使用其网站的指令的标准方式——而是积极阻止 AI 训练机器人。
“同意不应取决于抓取者是否选择遵守,” Patreon 的一篇博客文章解释道,提到更严格的措施。
在测试这些功能时,个别 AI 训练爬虫每周尝试访问 Patreon 的次数从 “数千次降至零”,该文章指出。这表明,AI 抓取者忽视了 Patreon 的 robots.txt 文件,仍然在抓取该网站,尽管有其请求。
然而,该公司表示,它将允许那些索引页面并组织信息的机器人,这些信息可以用于将用户引导回 Patreon。
“随着 AI 代理变得越来越强大和流行,创作者理应在他们的作品如何被 AI 公司使用方面拥有实质性的发言权,” Patreon 的产品负责人 Drew Rowny 在公告中表示。“在大多数互联网环境中,创作者必须接受 AI 对他们作品的训练,以便接触和发展受众。Patreon 有不同的愿景:创作者应该能够发展他们的受众,并控制他们的作品如何被使用。”
