全部文章

Search、Agent 与 Training:Web 的新 Bot 规则

Cloudflare 现在按用途而非行为对 Bot 进行分类:Search、Agent 或 Training。9 月 15 日的默认设置范围比预期的更窄,而且还缺少了一个关键选项。

网络正在根据意图而非行为对 Bot 进行分类

过去十五年里构建的所有反 Bot 系统都在问同一个问题:该流量看起来像自动化的吗?Header 顺序、传输层指纹、鼠标轨迹、会话时序。这一切都在试图根据 request 的形态推断 client 的特征。

2026 年 7 月 1 日,Cloudflare 改变了这一核心问题。Bot 流量现在被划分为三个类别,这些类别与 request 在传输层上的表现毫无关联。Search 涵盖“建立内容索引以便后续回答相关问题的爬虫”。Agent 涵盖“代表个人实时执行操作的自动化活动”。Training 涵盖“抓取内容以训练或微调模型的爬虫”。

设想有三个 request 到达同一台服务器。相同的 client,相同的 header,相同的时序,细致到每个字节都完全一致。在这种模型下,它们可能会得到三种完全不同的判定结果,这完全取决于你在获取页面后打算用它做什么。

这并不是一个更出色的检测器,而是一个完全不同的原语。

9 月 15 日截止日期的实际影响范围远小于恐慌预期

开发者论坛 上流传的版本是:Cloudflare 将在 9 月 15 日拦截全网五分之一网站上的 AI agent。

变更日志中的实际内容则要克制得多。新默认配置仅适用于“新接入 Cloudflare 的域名”。在这些域名上,“被归类为 Training 或 Agent 的 bot 在展示广告的页面上会被拦截,而 Search 仍保持允许”。已经在 Cloudflare 上的所有用户均可自主选择配置,并可在截止日期前随时调整。

因此:仅限新域名,仅限包含广告的页面,且三个类别中仍有一个默认放行。这是一项实质性的改变,但并非直接封锁整个互联网。

但狭窄的适用范围正是值得关注的地方。Cloudflare 没有发布一项强制策略,而是发布了一个默认值,而默认设置往往能在未经任何人投票的情况下直接演变为行业规范。真正值得观察的数据不是 9 月 15 日这个节点,而是这些域名之后有多少再也没有修改过该设置。

**这意味着:**如果你从事数据采集,有价值的问题不再是“我能否绕过该站点的防护”,而是“该站点认为我属于哪个类别”。这两个问题有着不同的答案,而且只有前者是你可以直接测试的。

意图无法被度量,只能被声明

根据意图对流量进行分类存在一个底层机制上的难题:数据包本身并不包含意图。

指纹可以测量。鼠标移动可以测量。“你为什么要获取这个页面”却无法测量,因此系统需要客户端主动说明,并且需要一个相信该答案的理由。这正是 Web Bot Auth 的作用。Agent 使用私钥对其 request 进行签名,发布密钥目录,边缘节点则对照该目录验证签名,该机制基于 RFC 9421 HTTP Message Signatures 构建。Cloudflare 的文档将已验证 Bot 的门槛定义为“诚实的自我身份识别”。

现在来看看在大规模场景下执行这一机制的基础。该规范为 draft-meunier-webbotauth-httpsig-protocol-02,最后修订于 2026 年 8 月 18 日。预期状态:标准轨道(Standards Track)。实际状态:一个“未获得 IETF 认可”且“在 IETF 标准化流程中没有正式地位”的“活跃互联网草案(个人提交)”。它有两位作者,一位就职于 Cloudflare,另一位就职于 Google。

我们认为这一设计是正确的,在提出批评之前有必要先说明这一点。对于意图合规的一方来说,签名身份优于 CAPTCHA 军备竞赛。能够主动表明身份的爬虫可以被有针对性地放行、限流或计费,而不是靠猜测;网站所有者也能获得一种不会误伤真实访客的控制手段。相比十年来封禁 IP 段并寄予希望的做法,这显然更进一步。

但它无法做到的是阻止任何人。建立在声明意图之上的系统,只能对主动声明的流量进行分类。其余所有流量都会回退到既有的检测技术栈中,而该技术栈正变得越来越敏锐:Cloudflare 的 会话级行为评分机制 在新分类推出 12 天后即已上线。

因此这两者并不冲突。身份验证用于归类诚实的流量,检测机制处理其余流量;如果你从不声明任何信息,你的流量默认就会落入第二种机制中。

公开数据采集没有对应的分类

现在来看看足以困扰所有数据采集流水线维护者的部分。

以我们今年发布的工作为例:基于公开挂牌信息构建的 木材价格指数跨六个电商平台的最低限价(MAP)违规检测,这意味着需要从六个不同的网络节点获取同一个产品页面并比对各自显示的内容。应用商店排名与评论情绪分析从广告活动实际投放的国家/地区执行的广告展示位置检查

把这些归入 Search(搜索)、Agent(智能体)或 Training(模型训练)试试看。

搜索并不适用:Cloudflare 自身的定义附带了“换取引流流量或其他对等补偿”的预期,而夜间价格检查不会给任何人带来引流。Agent 也不适用,因为没有人类坐在屏幕前等待抓取结果。训练显然更不对,因为没有任何数据被吸收到模型中。

这是一套用来描述过去三年中出现的 AI 流量的分类法,如今却被套用在早于它十年前就存在的业务上。价格情报、另类数据、SERP 追踪、品牌保护、广告验证、合规监控:这些都不是新事物,都不是 agentic 模式,也没有现成的选项可勾选。

没有明确归类的流量会由画定分类规则的人来划分。通常会被归入最接近的一类。

这对数据团队意味着什么

在规则尚未定型之前,有四件事值得去做。

**确定你能够如实主张的类别。**不是能让你蒙混过关的类别,而是在发布商直接询问时你愿意书面辩护的类别。如果真实的答案是“以上都不是”,那么在分类体系固化时你的损失最大;趁现在尚存讨论空间公开表明立场,你的获益也最大。

**研读目标站点的具体设置,而不是看新闻头条。**站点的 bot 策略现在属于该站点自身的属性,可以按路径单独配置,并且会随时更改。如果把“Cloudflare 在 9 月封禁 agent”当作关于你数据管道的既定事实,会导致你去重构那些根本没有风险的组件。

**假定广告页面测试会扩散。**Cloudflare 将其默认规则与展示广告的页面绑定,这是衡量“该页面通过人类注意力获利”的一个合理替代指标。这条界线会发生变动,而且 Cloudflare 也不是唯一画线的人。AWS WAF 于 2026 年 6 月 15 日上线了 AI traffic monetization,返回 402 状态码以及机器可读的支付条款。Akamai 选择了与 TollBit 及 Skyfire 合作的路线。三大边缘提供商如今都在销售相同的控制面,我们在 按次抓取付费功能推出时已从定价角度探讨过这一点。

**确保你的采集系统能够兼顾两条路径。**已实名路径(签名、声明、获得放行或被计费)和未实名路径(像往常一样根据行为进行判定)将在未来数年内共存。无论偏向哪一方,只按单一路径存在来构建系统都是代价高昂的错误。

这些分类将被重新划分

我们乐于接受验证的一个预测:一年内将会出现第四个类别。

任何分类标准的初版往往都由承受压力的一方制定,而被分类的人在制定时根本无法参与其中。Search、Agent 和 Training 描述的是 AI 公司对内容发布方所做的事情。它们无法描述市场研究机构、合规团队或监测竞品货架价格的零售商,而早在“agent”在此场景下产生实际含义之前,这三类主体就已经在规范地抓取公开网页了。

关于第四个分类框该如何命名以及谁有权勾选它的争论,对数据行业的重要性将超过今年发布的任何反爬基准测试。这场博弈值得全力以赴。

因为退路很简单。如果你的流量无法自主定义身份,别人就会替你定义。