Cloudflare 上线新设置:允许搜索引擎爬取,同时拒绝 AI 训练

Cloudflare正式推出爬虫管控规则调整,针对AI爬虫无序抓取内容用于模型训练的问题,给出了新的解决方案。此次调整核心是重新划分爬虫类别、调整默认拦截规则,在允许搜索引擎正常抓取网站的前提下,给内容方提供了单独拒绝AI训练爬虫的选项。

Cloudflare 上线新设置:允许搜索引擎爬取,同时拒绝 AI 训练

9月15日起Cloudflare默认开启混合爬虫最严拦截规则

此次规则调整针对新客户、新上线网站以及未在9月15日前修改过设置的现有免费用户生效。默认状态下,带有广告页面的网站将自动屏蔽AI训练爬虫和AI代理爬虫,传统搜索爬虫则保持允许状态,用户如需调整需手动进入Cloudflare控制面板修改设置。
调整还引入了“最严规则优先”原则:如果某个爬虫同时具备搜索抓取和AI训练两种功能,只要网站所有者选择屏蔽训练类爬虫,该爬虫的整体访问权限都将被关闭。Cloudflare以Googlebot、Applebot、BingBot等主流爬虫为例,这些爬虫均同时承担搜索索引和AI数据采集功能,若网站启用训练爬虫屏蔽规则,将直接被拦截。此前已开启Cloudflare旧版“阻止AI机器人”选项的网站,也会受到此次规则变更的影响。
Cloudflare CEO Matthew Prince此前曾公开指出,互联网bot流量超过人类流量的里程碑比行业预期提前3年到来,此次规则调整正是应对AI爬虫无序扩张、平衡内容方权益与互联网生态健康的关键举措。

AI爬虫首次被拆分为三类可单独管控

Cloudflare此次最大的规则变化,是将此前笼统归为“AI爬虫”的群体拆分为三个可独立管控的类别,网站所有者可以针对每一类单独设置允许或屏蔽规则:

  • Search类:即传统搜索引擎用于构建索引的爬虫,是运营二十余年的常规搜索抓取工具
  • Agent类:实时代替用户访问网页的AI代理爬虫,例如用户使用生成式AI工具查询信息、填写表单时,背后运行的代操作爬虫
  • Training类:大规模抓取网页内容用于训练大语言模型的爬虫
    这一分类机制打破了此前AI爬虫“一刀切”的管控逻辑,网站方可以选择允许搜索引擎抓取以保障搜索流量,同时单独屏蔽训练类爬虫,避免内容被无偿用于AI模型训练。但由于主流搜索引擎爬虫普遍存在“搜索+训练”的混合属性,分类管控的落地仍面临现实阻碍。

混合爬虫特性导致Googlebot等主流搜索爬虫或遭批量拦截

由于“最严规则优先”原则的落地,混合属性爬虫将成为此次规则调整下最容易“被误伤”的群体:只要网站所有者选择屏蔽Training类爬虫,同时承担搜索和AI训练功能的Googlebot、Applebot等爬虫,将直接被整体拦截,哪怕网站方原本仅希望限制AI训练抓取。
这一规则直接戳中了当前搜索引擎与AI业务绑定的核心痛点:Google官方虽提供了Google-Extended工具,允许网站方选择性退出AI训练抓取,但Googlebot核心爬虫的架构中,搜索索引和AI功能(如AI Overviews)的数据采集并未完全分离,网站方为了维持在Google搜索中的可见度,不得不默认允许Googlebot抓取,也就等于默认允许了AI训练数据的采集。Cloudflare披露的数据显示,Google的爬取回流比约为14:1,即每抓取14个网页仅会为网站带来1次回流点击,而OpenAI的爬取回流比高达1700:1,侧面反映出Google通过混合爬虫获取的内容量远高于其他AI厂商。
值得关注的是,Cloudflare层面的拦截作用于网络层,比传统的robots.txt协议效力更强:robots.txt仅为非强制性的抓取请求,Google等厂商可选择无视,而Cloudflare的规则拦截无法