Cloudflare 给全网站长发了张独立宣言:搜索、AI 智能体、训练爬虫终于能分开管

小岛AI 2026 / 07 / 02

全球超过五分之一的网站,今年 9 月 15 号之后会悄悄换一套默认规矩。

不是升级 UI,也不是涨价。是 Cloudflare 决定,替这些站点默认拦下一部分 AI 流量。7 月 1 号那天,它发了篇博客,标题起得挺硬气,叫你的网站,你说了算。落款一句话我盯着看了好一会儿,Happy Content Independence Day,内容独立日快乐。

这是它们搞的第二个内容独立日了。第一个是去年这时候,当时的核心动作简单粗暴,一键封掉所有 AI 爬虫,外加一个叫 Pay-Per-Crawl 的市场,想爬我的内容训练模型,行,按次付钱。

去年那版设置,拦 AI 爬虫就一个粗暴的开关

一年过去,风向变了。而且变得挺有意思。

先说清楚一件很多人没太在意的事。互联网跑了三十年的一个隐形契约,是搜索引擎跟网站之间的。爬虫来抓你,抓完把你排进搜索结果,用户点进来,你拿到流量。你被爬,你也得利,一手交钱一手交货,双方都不亏。这个默契撑了三十年。

然后大模型来了,把桌子掀了。

AI 把你的内容整个吃进去,喂给模型,用户以后再也不用点进你的网站,直接在对话框里就把答案拿走了。你被爬,但你什么都没拿到。抓取还在,回流没了。对一个靠流量吃饭的网站来说,这不是少赚点的问题,是断粮。

坦率讲,去年那个一键封杀,我一开始是有点将信将疑的。因为对小站长来说,封了 AI 就等于做了一个魔鬼交易。你要么出现在搜索里、顺带被拿去训练,要么谁都搜不到你,直接从互联网上消失。Cloudflare 自己在文里也把这层说破了,你不是怕被训练,你是怕根本没人能找到你。

这就尴尬了。因为搜索和训练,很多时候是同一个爬虫在干。Google 的爬虫既帮你做搜索索引,也顺手把你的内容收进训练集。你想挡训练,就得连搜索一起挡,那你等于自杀。老牌搜索巨头因为一套爬虫两头通吃,天然占了便宜;后来的新玩家追不上,就只能偷偷摸摸绕着走。整个生态被逼得越来越不透明。

好家伙,问题的根其实不在封不封,在于粒度太粗了。

所以这次它换了个思路

以前大家争的是,这个 bot 算不算 AI。Cloudflare 说这个争论没意义,因为今天什么都能塞进 AI,Google 搜索都从排序器变成了直接吐答案的引擎,你今天定的 AI 标准,明天就作废。

与其纠结它是不是 AI,不如问三个更实在的问题。它在我站上干嘛,它存了什么,它拿走之后会怎么二次分发。

顺着这三个问题,它把爬虫拆成了三类,我觉得这个拆法是全文最值钱的地方。

第一类叫 Search,搜索。它来扫你的站,建个索引,方便以后回答别人的提问。关键点是它在给你攒一个数据库,好处是会把访客再导回来,所以你多半愿意放行。

第二类叫 Agent,智能体。这是这两年冒出来的新物种,是替某个真人实时干活的自动化程序。比如你让 ChatGPT 现场去翻一个网页(它派出的抓取 bot 叫 ChatGPT-User),或者 Gemini、Claude 直接驱动一个 Chrome 浏览器替你操作。关键点是屏幕另一头有个大活人在等结果,它是来办事的,不是来收藏你的。

第三类叫 Training,训练。爬走你的内容去训练或者微调模型。关键点是你的数据被永久焊进了模型的底层结构里,喂完就融进去了,拿不回来。

你品品这三类。Search 会给你回流量,Agent 是有人在等着用,Training 是吃干抹净啥也不留。同样是自动化流量,性质天差地别,凭什么用一个开关一刀切?这话听着朴素,但过去一年大家吵得脸红脖子粗,就是没人把这层给捅破。

Cloudflare 还顺手立了个规矩,一个爬虫如果同时干这三件事,就得被三个身份同时记账,不能只挂一个名。它甚至在文里直接喊话,你要是又做搜索、又当 agent、又搜集训练数据,麻烦你拆成三个独立爬虫,别混在一起浑水摸鱼。

新面板把搜索、训练、智能体拆成三个独立开关,各调各的

真正会咬人的是 9 月 15 号

新的开关现在就能用,连免费用户都能调,这算送的福利。但真正有杀伤力的是默认值。

Cloudflare 说了,9 月 15 号起,所有新接入的域名,在那些挂了广告的页面上,Training 和 Agent 两类默认拦掉,Search 默认放行。

逻辑很直白。页面上挂了广告,说明站长指望的是一个真人点进来、看到广告、这页能变现。那在这种页面上,人的注意力才是终点,会挡路的 bot(也就是训练和 agent)先请出去。而搜索天然会把真人再送回来,留着对大家都好。

厉害了,这一刀切在了广告页上,等于精准保护了站长的钱袋子。

还有个连带效果更狠。那些一鱼两吃的爬虫,典型的比如 Googlebot、Applebot、BingBot,既做搜索又做训练。9 月 15 号之后,只要你勾了挡训练,这几个大爬虫会因为最严规则优先,被整个挡在门外。这对 Google 们是实打实的压力。当然 Cloudflare 也留了后门,你要是不想被这套新默认动到,随时能去安全设置里手动关掉,它也会在 9 月 15 号前反复提醒你。

我看到这儿停了一下。一家 CDN 公司,靠给全网两成站点当门卫这个位置,硬是把自己变成了一个能改写行业默认行为的规则制定者。这种玩法有点子牛逼了。默认值这东西,绝大多数人是不会去改的,谁把默认值攥在手里,谁就悄悄改写了整个游戏。

光有开关不够,它还想解决信任问题

后面几块是给技术上头的朋友准备的,我觉得比前面的开关更能看出野心。

一个是可见性。它上了个叫 BotBase 的东西,把所有已知的 bot 建成一个能搜索的数据库,摊在面板上给你看,谁是什么身份、归到哪一类,一目了然。企业版用户还能一键筛出某个 bot 的全部流量,复制它的检测 ID 直接写进安全规则。以前这些是黑箱,现在给你开了盏灯。

BotBase 里每个 bot 都标了行为分类和审核状态,还带检测 ID

比这更细的一层,叫内容用途。同样被抓走,人家抓完拿去干嘛,差别很大。Cloudflare 借着 Content Signals 这个标准,在你网站的 robots.txt 里加了个新字段叫 use,三档。

immediate,用完即走,啥也不存。reference,允许索引、摘录、但要带链接回来,这是默认档。full,允许总结甚至整段复现。

于是你能写出很细的规则,比如允许所有搜索、SEO、广告核验类的 bot,但只准到 reference 这一档,不许给我整段抄走。你启用了托管 robots.txt 的话,它现在会自动帮你把 use=reference 写进去,长这样。

User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /

哪个 bot 敢无视这个信号乱来,就会被摘掉 Verified 认证,直接失去访问权。会整段复现你内容的 bot,现在压根拿不到 Verified。

说真的,最让我眼睛一亮的是最后那块,它管这叫可传递的信任。

现在站在你门口的那个 bot,越来越可能不是造它的那家公司在跑了。比如 Cloudflare 自己的开发者平台,一次就替成千上万个开发者跑自动化,里头有大厂,也有你压根没听过的某个人的周末小项目。你可能信得过某个知名支付工具,但你不见得信得过每一个把这个支付工具接进自己项目的陌生开发者。

这是个老问题了。你信 A,A 用了 B,那你到底信不信 B?

Cloudflare 的解法是复用一个 2003 年就定好的老标准,RFC 7239 里的 Forwarded 头。这个头本来是让代理层把中转过程中丢掉的信息补回来的,跟 X-Forwarded-For 保留原始 IP 是一个路子。现在让请求一路带着它,里头写清楚我是谁、我打算怎么用你的内容。

Forwarded: for="openai";use="reference"

翻译成人话,就是这个请求在跟你自报家门,我是 openai 派来的,我保证只做到 reference 那一档。哪怕它中间转了三层可信中介才到你这儿,你当初说的「这家我放行」,一路都算数。

这一步棋的精妙之处在于,它把信任变成了一个能随身携带、也能被没收的东西。你在全网超过 20% 的域名上一旦失信,代价是你在这五分之一的互联网上都会被拉黑。这个威慑,是有牙齿的。

它自己也承认这套不完美。当 bot 流量和真人流量越混越难分,这种可传递信任大概只对那些愿意亮明身份的玩家有效,小流量、想保护隐私的角色未必套得进来,未来还得靠私有限流这类更细的积木去补。这份坦白我挺受用的,比那种张口就是我们彻底解决了 XX 的通稿舒服多了。

写在最后

绕了一大圈,我越想越觉得,这事表面是几个爬虫开关,底下是一场关于「谁说了算」的重新洗牌。

三十年前那个爬虫和网站的老契约,是被大模型这波浪潮拍碎在礁石上的。碎了之后大家慌了一阵,去年的第一反应是把门焊死,一键全封。可焊死解决不了问题,只会让小站长在「被吃干」和「被遗忘」之间二选一,两条路都是死。

今年这套东西,本质的转变是从「封不封」挪到了「怎么用」。不再是敌我通杀,而是把自动化流量摊开,看清它到底来干嘛、拿走之后怎么处理,再决定放行到哪一档。你做的事越透明,拿到的访问权越多;你越想浑水摸鱼,被挡的越死。诚实反而换来更大的通行权,这个激励方向,我是真的觉得对。

我干的活儿,日常就是给这些满地跑的 AI agent 搭运行的脚手架,看着它们怎么调工具、怎么跑、怎么翻车。所以看到 Agent 被单拎出来当成一类流量对待的这一刻,还挺感慨的。前两年这些自动化程序还是野孩子,在互联网上横冲直撞,没人给它们定身份、立规矩。现在有人开始认真地问它们,你是谁,你来干嘛,你拿走之后打算怎么办。

一个能自己出海远航的东西,光会跑还不够,得有人先给它画一张海图,标清楚哪里是航道、哪里是暗礁、哪里禁止靠岸。9 月 15 号,就是这张海图开始生效的日子。

到时候受影响的,可能就有你天天在逛的某个网站。