Cloudflare宣告爬虫黑盒终结:AI训练数据获取进入付费强制时代

2026年9月15日,Cloudflare对所有新接入域名实施一项技术新规:含广告页面上,AI训练爬虫与Agent爬虫默认封锁,搜索爬虫保持通行。Googlebot、Applebot、BingBot这类兼具搜索与训练功能的混合爬虫,按“最严限制规则”处理——训练类被封,整个爬虫即被拦截。该规则适用于新客户、新建站点以及所有现有免费用户;付费用户的既有配置暂时保留。Cloudflare联合创始人兼CEO Matthew Prince表示:“互联网流量已由非人类主导,我们必须更快行动。”

三类爬虫、三级权限:一套可执行的分类框架

新规将“AI爬虫”拆解为三个行为类别。搜索类爬虫建立内容索引以备查询;Agent类代表用户实时执行操作,包括ChatGPT和Claude的浏览器代理;训练类将内容永久吸收进模型权重。三种行为的商业后果不同,此前技术拦截工具无法区分。

同步落地的三级内容使用权限包括:immediate允许交互但不得存储,reference(默认值)允许索引、摘录并附回链,full允许摘要和再现全文。网站主可精确指定某类爬虫的使用方式。“已验证爬虫”的身份认定也变更:验证仅为准入前提,能否通过取决于其所属类别是否被允许。

付费逻辑的本质升级:从按抓取到按价值

Cloudflare去年推出的Pay Per Crawl按实际抓取次数计费,但数据显示,AI爬虫超过50%的抓取流量来自对未发生变化页面的重复请求。Pay Per Use将计费锚点从“抓没抓”移到“用了没用”:内容实际出现在搜索结果中,或Agent实际访问付费内容,才触发结算。Cloudflare已与Ceramic.ai和You.com启动试点,前者让出版方内容出现在搜索结果中即获补偿,后者允许Agent按需为高价值内容即时付费。

各方利益的重新分配

对内容创作者和出版商而言,新规在“爬虫换流量”隐性协议崩裂后重建补偿机制。AI大模型大规模抓取语料却截留流量,Cloudflare的分类封锁在技术上堵住通道,强制AI公司在“训练语料”和“引流”之间做出取舍。

对AI实验室而言,训练数据获取成本将持续攀升。随着网站迁移或切换至新默认设置,可自由抓取的“干净训练语料”将收缩。出路包括与内容平台谈判直接授权、接受Pay Per Use计费、或转向合成数据与已授权语料库。

对Agent开发者而言,实时访问网络的依赖面临阻断。Agent类爬虫在含广告页面上默认被封锁,调用第三方内容的摩擦成本增加,除非平台事先建立授权关系。You.com试点显示,Agent的边际运营成本不再为零,将影响产品定价和商业化路径。

小型网站主面临两难:封锁训练爬虫无法让用户流量返回,却可能损害在AI搜索平台中的可见性。这一矛盾取决于各网站的规模与商业模式。

三十年协议的终结:声明与执行的本质区别

1994年诞生的robots.txt是“君子协定”,缺乏技术执行力。Cloudflare将“爬虫分类许可”嵌入全球20%互联网流量的必经节点,使“权限”从文档声明变为防火墙规则。Cloudflare数据显示机器流量已首次超过人类互联网流量总量,这为默认封锁提供背景。

前瞻判断

训练数据授权协议将快速商业化。大型内容平台将与AI公司签订批量授权协议以绕开按次计费;中小型网站则成为“默认封锁”阵营的受益者。训练成本上升将加速行业分化:拥有大量用户生成内容的平台方受冲击有限,依赖公网爬取的挑战者面临更高准入门槛,这对现有头部模型形成护城河效应。

Googlebot作为混合爬虫,在“最严限制”条款下面临被批量封锁风险。若Cloudflare规则广泛采用,Google将被迫将搜索爬虫与训练爬虫物理拆分,这将影响其AI Overviews的数据来源结构。Ceramic.ai和You.com试点的实际补偿规模,是判断Pay Per Use能否商业落地的验证节点。