← 全部文章

Pay-Per-Crawl 正在将 Web 一分为二

Cloudflare 的 Pay-Per-Crawl 市场和 HTTP 402 将 Web 划分为授权数据和公开数据。以下是 2026 年收集 Web 数据的团队将面临的转变。

2026 年 2 月 19 日,Stack Overflow 和 Cloudflare 公开了一项令大多数网络数据行业始料未及的合作。他们 联合推出了按抓取付费(pay-per-crawl)机制:在该系统中,AI 爬虫会收到实时的 402 Payment Required 响应,并可选择按发布者设定的价格付费或直接退出。Bot 身份在边缘完成验证,价格由站点设定,交易按量计费。

Cloudflare 位于互联网大约五分之一的站点前端。因此,当他们对已知 AI bot 启用默认拦截,并建立一个允许发布者按 request 收费的市场时,开放网络中很大一部分的访问模式在一个周末内彻底改变。

如果你目前正在构建网络数据基础设施,这绝不仅是一篇可以搁置的 Cloudflare 公告。它改变了衡量“开放”含义的底层逻辑。

机制背后的逻辑

技术层面的改动并不大。Cloudflare 重新启用了长期闲置的“Payment Required”状态码 HTTP 402,并将其接入已验证 AI 爬虫的注册表中。发布者设定每个 request 的价格。爬虫要么持有积分余额并完成支付,要么被拦截。

非技术层面的影响更为深远。在此之前,执行“禁止为 AI 抓取我的内容”的唯一方式只有 robots.txt(建议性质,无强制力)和激进的 bot 拦截(非黑即白,易造成损耗且充满误报)。Cloudflare 增加了第三种选择:明码标价。

这第三种选择的经济逻辑与前两者截然不同。Robots.txt 零成本却常被无视。Bot 拦截会因误判真实用户而损失流量。而价格机制在设计上直接将愿意付费的爬虫与不愿付费的爬虫区分开来。

谁在真正收费

Stack Overflow 作为首发合作伙伴,是因为其训练数据具有极高的实际价值,且他们此前已在与 OpenAI 等机构展开双边谈判。Cloudflare 的市场将这些双边交易通用化为一个注册表,供其他发布者直接接入。

跟进者的名单增长迅速。AWS 推出了自己的 bot 变现层。Akamai 也构建了类似系统。对发布者的宣传逻辑非常直接:与其对 AI 实验室发起昂贵的诉讼,不如获得一条按 request 付费的收入流。

目前这主要集中在高价值内容层:文档、新闻、技术问答和结构化参考数据。网络的长尾部分(小型电商网站、区域分类信息、小众论坛)并未设立此类门槛,未来可能也不会。Cloudflare 自身的 bot 管理需要运行成本,且按抓取付费属于自愿加入。它仅对单次页面浏览值得收费的站点具备经济效益。

这对网络数据 Pipeline 意味着什么

如果你正在构建一个从 Stack Overflow、主流新闻网站或任何正在主动接入此类服务的发布商抓取数据的 pipeline,你的选择将缩减为三个。一旦你的流量被识别为 AI 爬虫,就通过该市场付费。在存在授权数据集的情况下,转向使用授权数据集。或者在数据仍然开放的地方寻找数据。

大多数团队最终会在不同阶段同时采取这三种做法。这是现实情况。网络正在分裂为授权内容和开放内容两部分,而且这种界限并不是严格按域名划分的。同一发布商可能将某个板块置于 402 之后,而将另一个板块保持开放。同一个站点可以对某一个爬虫收费,而对研究型 bot 完全忽略。

我们认为工程团队的务实应对策略如下。首先,审查你的数据源。如果你 pipeline 中有相当一部分数据来自 Stack Overflow、Reddit、主流新闻网站,或者正在明显寻求此类交易的十几家发布商中的任何一家,请假定其访问模式将在 12 个月内发生变化。其次,尽早在架构内部将授权数据源与开放数据源分离开来。当半数数据源开始收费而另一半不收费时,将所有数据源一视同仁的 pipeline 会变得极其脆弱。第三,不要再将 robots.txt 视为唯一的信号。即使你的爬虫不是 AI agent,402 响应在运维层面也具有实际意义。在这样一个全新的系统中,误报是不可避免的。

这与来自 欧盟人工智能法案(EU AI Act)的训练数据合规压力并存,该法案已经推动各团队转向具有来源追溯能力的数据源。按次付费抓取不过是在同样的合规压力上附加了一个计费层。

坦率的看法

有几个问题会让人们陷入困境。Cloudflare 的身份验证依赖于 bot 自行注册。未注册的 bot,或者看起来像住宅 IP 流量的 bot,根本不会触发 402。它们会直接撞上常规的 bot 检测。这已经是大多数激进的 AI 爬虫会选择的路径。因此,按次付费抓取仅对愿意遵守规则的 bot 有效。那些不愿意遵守规则的 bot,本来也就不会遵守 robots.txt。

更大的转变可能不在于市场本身。而在于“此内容是否可用于 AI 训练”变成了一个具有合同明确答案的问题,而不再依赖 robots.txt 的猜测。发布商终于能够强制执行。爬虫也终于能够明确知晓。在市场覆盖的范围内,灰色地带正在缩减。

依然处于灰色地带的是市场覆盖范围之外的一切。没有使用 Cloudflare 的小型网站、没有 AI 策略的区域性聚合站点、无人洽谈合作的长尾网络:这些既不会返回 402,也不会达成授权协议。它们保留之前采取的任何访问策略,只是在有了补偿先例之后,抗议的声音变得更加响亮。

未来的走向

两个预测,而且并非保守的预测。

第一:未来十二个月将出现第二层付费墙,这次是针对非 AI bot。市场机制本质上只是一个 HTTP 状态码和一个计费层。将其扩展到搜索爬虫定价、归档 bot 定价或竞品监控定价在技术上并不难。发布商是否会坚守只向 AI 爬虫收费的底线,取决于下一波流量的表现。但在多数年份,这条底线都会被打破。

第二:AI 实验室会绕过它。他们不会选择直接忽略 402(这种行为可被追踪且会引发诉讼),而是批量购买授权数据集,然后将其他所有请求伪装成真实用户流量来运行。Cloudflare 已经在推出更多行为检测功能,正是因为他们清楚这一点。我们已经观察到 这场军备竞赛转向会话级信号整整两年了。这绝不会止步于一个交易市场。

对于构建者来说,真正值得关注的问题不是要不要付费。而是在哪些领域开放网络依然能够保持开放,以及还能维持多久。