夜雨聆风学习资料网

ARTICLE · 1001192

可以搜索,不能训练:网站开始给AI发三种通行证

可以搜索,不能训练:网站开始给AI发三种通行证
今天起,一批网站会对AI说出一句看起来矛盾的话:你可以来搜索,但不能拿这些内容训练模型,也不能让智能体直接使用。

Cloudflare在7月1日公布了这项安排,并把9月15日设为生效节点。对于新客户、新增网站,以及到今天仍未修改相关设置的现有免费客户,含广告页面的默认规则变为:允许搜索用途,阻止训练和智能体用途。一个爬虫如果把搜索、训练和智能体访问混在同一个身份里,网站无法分别选择,它就会被这些页面默认拦下。

这不是“网站拒绝AI”。恰恰相反,它第一次把过去笼统的“AI能不能抓”拆成了三个问题:内容能否被找到,能否进入模型,能否在用户发问时直接成为答案或行动的输入。

Cloudflare官方展示的“AI bot controls”设置界面:Search、Training、Agent被拆成三类,搜索可放行,训练和智能体可只在含广告页面阻止。图源:Cloudflare。

同一次抓取,背后是三种生意

搜索抓取的基本交换很容易理解。

网站允许搜索引擎读取页面,搜索结果提供链接和短摘要,把用户带回原站。网站用内容换曝光,再通过广告、订阅、商品或服务完成收入。抓取不是目的,引流才是交换成立的原因。

训练抓取不同。内容进入模型训练或微调之后,会参与塑造模型长期能力。原网页未必在用户使用模型时被再次访问,网站也很难从一次回答追溯到哪篇内容发挥了多大作用。对内容方来说,这是把现有作品变成模型的生产资料。

智能体访问又是第三种用途。它可能在用户提问的当下读取网页,为回答提供事实;也可能替用户比较商品、查询库存、安排旅行或完成交易。Cloudflare的Content Signals把这类实时输入称为`ai-input`,包括检索增强生成、事实锚定和生成式搜索答案。它和训练的差别在于“当下使用”,和传统搜索的差别在于,用户有可能在AI界面里直接拿到结果,不再点击原网页。

因此,“允许搜索、拒绝训练”并不矛盾。网站愿意被找到,不等于愿意被训练;愿意提供链接和短摘要,也不等于愿意把全文直接交给答案引擎。

Google自己的爬虫规则也已经体现了这种分离。`Googlebot`影响Google搜索收录;`Google-Extended`则用于让网站管理内容是否可被用于Gemini训练和搜索锚定,而且Google明确说明,限制后者不会影响网站进入Google搜索,也不是搜索排名信号。

9月15日改变的,是默认选项

Cloudflare没有给全网制定新法律,也没有替所有网站作出永久决定。

它改变的是自己网络中的默认配置,而且范围带着四个限定:新客户、新网站、未自行修改设置的现有免费客户,以及含广告的页面。客户随时可以在控制台重新允许或阻止某类爬虫。

默认选项仍然重要,因为大多数网站不会逐一研究数十个爬虫的身份和用途。过去,混合用途爬虫把“能否被搜索”和“能否被AI使用”绑在一起,网站如果全部放行,就可能同时放行训练;如果全部拒绝,又可能失去搜索曝光。

Cloudflare这次把成本倒了过来:爬虫想获得不同用途的访问权,先要把身份和目的拆清楚。可识别、用途透明的爬虫可以被分别管理;无法区分用途的混合爬虫,在相关广告页面上先被挡在门外。

这使“机器访问”从一个开关,变成一张权限表。

为什么内容方不愿再给一张通票

Cloudflare披露,过去一年,出版商与AI平台已经签署超过50项重要内容许可协议。这个数字来自公司统计,并不是全球完整合同清单,但它至少说明:内容授权已经从原则争论进入真实采购。

与此同时,访问本身也在制造成本。Cloudflare称,超过50%的AI爬虫流量用于重新抓取没有变化的网页。每一次重复抓取都会消耗网站带宽、服务器资源和AI公司的计算,却没有带来更新的信息。

还有一个更微妙的数据。Cloudflare称,最大的搜索引擎可以访问的信息量大约是领先AI公司的两倍,原因在于网站很难既保留搜索可见性,又拒绝同一爬虫的其他AI用途。这同样是企业口径,不能当作独立审计后的全网份额;但它准确指出了混合身份带来的谈判优势:当搜索入口和AI使用权绑在一起,网站很难只拒绝其中一项。

过去一年超过50项重要内容许可协议、超过50%的AI爬虫流量用于重抓未变化页面,以及约2倍信息访问差距均为Cloudflare公司口径。HaiDatas制图,资料来源:Cloudflare。

问题的核心不是爬虫数量,而是谁从每次访问中得到什么。

传统搜索通常给网站带回一次可计量的点击;AI训练获取的是长期模型能力;答案引擎和智能体则可能直接完成用户任务。三种用途创造的价值不同,却长期共用同一个“抓取”动作,冲突自然会集中到入口。

robots.txt为什么还不够

网站过去主要通过`robots.txt`告诉爬虫哪些路径可以访问。RFC 9309把这套协议标准化,同时明确写道:这些规则不是访问授权。Cloudflare的文档说得更直白——`robots.txt`表达偏好,合规依赖爬虫自愿遵守;要真正拦截,还需要AI Crawl Control、WAF或机器人管理规则。

Content Signals是在这份旧文件上增加用途标签。网站可以写明:`search=yes`,允许建立搜索索引并提供链接和短摘要;`ai-input=no`,拒绝在用户提问时把内容送入模型;`ai-train=no`,拒绝训练或微调。

这解决了“想表达什么”,却没有自动解决“对方是谁”和“对方会不会照做”。一个爬虫可以伪装User-Agent,也可能无视声明。Cloudflare因此把监测、身份验证和网络层拦截放在声明之后:先看见访问者,判断它的用途和是否遵守,再决定放行、阻断或收费。

换句话说,`robots.txt`像门口告示,网络访问控制才是门锁。

下一步不是只会封锁,而是给访问定价

当用途被分开,网站就不必只在“免费开放”和“彻底封锁”之间二选一。

Cloudflare正在测试的Pay Per Crawl给出了第三个选项:收费。网站按域名设置每次成功抓取的价格,最低为0.001美元。爬虫第一次访问付费页面时会收到`HTTP 402 Payment Required`和价格;愿意支付,就在经过身份验证的请求中带上可接受价格,成功返回`HTTP 200`后再记录实际费用。

这套产品目前仍是封闭测试,不能写成已经普遍运行的网页收费标准。Cloudflare也只是其中的技术和结算中介。网站设定的价格是否有人愿意付,单次抓取能否覆盖内容生产成本,按抓取收费会不会刺激更多缓存和更少更新,都还没有足够的公开数据。

而且按“抓了几次”计费也未必是最终形态。Cloudflare已经提出从Pay Per Crawl走向Pay Per Use:内容真正出现在AI搜索结果、被引用或帮助智能体完成一次高价值任务时再付费。前者容易计量,后者更接近内容创造的价值,但也更难归因。

网站可以先声明搜索、AI实时输入和训练用途,再通过身份识别决定允许、阻止或收费;仅有robots.txt声明并不等于完成强制执行。HaiDatas制图,资料来源:Cloudflare与RFC 9309。

网站真正需要的是一套“机器访客账本”

对内容网站来说,新的运营问题不再只是SEO。

它至少要知道四件事:谁来抓了哪些页面,抓取声称用于什么,遵守了哪些规则,以及这些访问带回多少点击、引用、订阅或收入。没有这本账,网站既无法判断该不该放行,也没有基础与AI公司谈授权价格。

Cloudflare官方展示的Attribution Business Insights界面,可以同时查看机器人流量、内容页请求、抓取与回流比例,并按搜索、智能体、训练分类。图中数字为官方产品界面示例,不代表全网真实统计。图源:Cloudflare。

对AI公司来说,透明身份会成为新的基础设施。把搜索、训练和智能体访问拆成不同爬虫,短期增加了工程和合规成本,长期却能避免因为一个混合身份失去全部访问权。减少对未变化页面的重复抓取,也会直接降低计算与带宽浪费。

对普通用户来说,变化不一定表现为“AI突然看不到网页”。更可能出现的是内容分层:公开搜索可以找到标题和链接,AI回答只能引用获准内容,智能体访问高级信息时需要付费或跳回原站。搜索、答案和行动不再默认共享同一份网页权限。

网站正在把“被看见”和“被使用”分开

过去的开放网络建立在一个简单假设上:机器抓取最终会把人带回网页。

AI搜索和智能体改变了这条路径。机器不仅发现内容,还可能吸收内容、重组内容,甚至在不打开原站的情况下替用户完成任务。网站因此开始要求:每一种用途,都要有独立身份、独立许可和可计量的回报。

9月15日真正值得关注的,不是一家公司默认拦了多少爬虫,而是网络入口第一次开始按目的发放通行证。

可以搜索,不代表可以训练。

可以引用,不代表可以长期保存和复用。

能访问,也不再等于必须免费。

当这三条边界能够被机器读取、被网络执行、被账单记录,网站和AI之间的关系才从“先抓再说”,进入可以协商的阶段。


主要来源

Cloudflare 2026年7月1日公告[1]

Cloudflare AI Crawl Control[2]

Cloudflare Content Signals说明[3]

Cloudflare Pay Per Crawl文档[4]

RFC 9309[5]

Google爬虫说明[6]

参考链接

[1] https://www.cloudflare.com/press/press-releases/2026/cloudflare-allows-the-agentic-internet-to-flourish-with-a-simple-philosophy-your-content-your-rules/

[2] https://developers.cloudflare.com/ai-crawl-control/

[3] https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/

[4] https://developers.cloudflare.com/ai-crawl-control/features/pay-per-crawl/what-is-pay-per-crawl/

[5] https://www.rfc-editor.org/rfc/rfc9309.html

[6] https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers

相关学习资料

返回首页浏览学习资料