网站主以前只能二选一:让爬虫全进,或者全赶走。7月初,Cloudflare把AI流量拆成三档。
Cloudflare为大量网站提供代理和安全服务。新规的三类是:Search,搜索爬虫;Agent,智能体爬虫;Training,训练数据爬虫。网站主可以按场景允许或拒绝,而不必一次开关管全部。
生效条件和收费机制:
训练爬虫被默认关掉,意味着OpenAI、Anthropic、Google不能再把“全网默认可抓”当作训练数据的前提,要谈判,或者走网关付费。智能体单独成类,则是AutoGPT、Devin这类会自己浏览网页的程序,需要专门授权。原文把x402加稳定币,写成可能成为按次计费的基础设施,类比是AI时代的HTTP加Stripe。这是方向判断,不是已有的交易额。
对中国网站,影响被写成相对有限,因为很少托管在Cloudflare上。出海业务不同。字节跳动、阿里、DeepSeek的海外站点若走这套代理,训练数据的采购成本可能上升。更长的推论是,厂商会更倾向自有数据和合规的训练数据联盟。原文没有给出涨价幅度。
三档把以前的总开关拆开。Search留下,是为了Google、Bing还能做索引。Training默认关闭,针对的是拿网页去训练模型。Agent单独成类,是因为会自己浏览页面的程序和搜索引擎不是同一种访问。收费对象包括网页、数据集、API和MCP工具,结算用稳定币,避免币价波动直接改写每一次调用的价格。
9月15日只约束新加入的域名,不是当天关掉全部旧站。下一步看候补名单里有多少网站真的开收费,以及搜索爬虫会不会被误伤成训练爬虫。