← 全部文章

Search、Agent 与 Training:Web 的新 Bot 规则

Cloudflare 现在按用途而非行为对 Bot 进行分类:Search、Agent 或 Training。9 月 15 日的默认设置范围比预期的更窄,而且还缺少了一个关键选项。

互联网正在按意图而非行为对 Bot 进行分类

过去十五年构建的每个 Bot 检测系统都在问同一个问题:该流量看起来像自动化的吗?Header 顺序、传输层指纹、鼠标轨迹、会话时序。这一切都在试图通过 request 的特征来推断 client 的属性。

2026 年 7 月 1 日,Cloudflare 改变了这个问题。Bot 流量现在被分为三类,这与 request 在网络传输中的形态完全无关。Search 涵盖“为索引内容以便日后回答相关问题而运行的 crawler”。Agent 涵盖“代表个人实时执行的自动化操作”。Training 涵盖“抓取内容以训练或微调模型的 crawler”。

设想三个到达同一服务器的 request。相同的 client、相同的 header、相同的时序,甚至每个字节都完全一致。在这个模型下,它们可能会得到三种完全不同的判定结果,完全取决于你在获取页面后打算用它做什么。

这并不是一个更出色的检测器,而是一个完全不同的底层逻辑。

9 月 15 日截止日期的影响范围比恐慌传言更窄

在 开发者论坛流传的版本是,Cloudflare 将于 9 月 15 日在全网五分之一的网站上封禁 AI agent。

更新日志中的实际内容要有限得多。新的默认配置仅适用于“新接入 Cloudflare 的域名”。在这些域名上,“被归类为 Training 或 Agent 的 bot 会在展示广告的页面上被拦截,而 Search 仍然被允许”。所有现有的 Cloudflare 用户都可以自行选择配置,并可在该日期之前的任何时间完成设置。

因此:仅限新域名、仅限含广告页面,且三类中的一类默认仍可通行。这是一个实质性的改变,但并非直接切断整个互联网的访问。

但值得关注的正是这个狭窄的适用范围。Cloudflare 没有发布一项强制策略,而是发布了一个默认值,而默认值正是一种无需任何人投票就能演变为行业标准的方式。真正值得关注的数字不是 9 月 15 日,而是在这些域名中有多少之后再也不会去修改该设置。

**这意味着:**如果你从事数据采集,有价值的问题不再是“我能否穿透该网站的防护”,而是“该网站认为我属于哪个类别”。这两个问题有着不同的答案,而且只有其中一个是你可以通过测试验证的。

意图无法被测量,只能被声明

按意图对流量进行分类的技术痛点在于:数据包中并不包含意图。

指纹可以测量。鼠标移动可以测量。"你为什么抓取这个页面"却无法测量,所以系统需要客户端明确声明,并且需要一个相信该答案的理由。这就是 Web Bot Auth 的作用。Agent 用私钥为其 request 签名,发布公钥目录,边缘节点则对照目录验证签名,该机制基于 RFC 9421 HTTP Message Signatures 构建。Cloudflare 的文档将验证 Bot 的标准定为"诚实自述身份"。

现在来看看在大规模场景下执行这一机制的基础。规范是 draft-meunier-webbotauth-httpsig-protocol-02,最后修订于 2026 年 8 月 18 日。预期状态:Standards Track。实际状态:属于"Active Internet-Draft (individual)","未获得 IETF 认可"且"在 IETF 标准化进程中无正式地位"。它有两位作者,一位就职于 Cloudflare,另一位就职于 Google。

在我们提出批评之前需要明确一点:我们认为这个设计方向是正确的。对于意图合规的实体而言,签名身份优于验证页面的军备竞赛。主动声明身份的爬虫可以被明确允许、限流或计费,而不是依赖推测;网站所有者也获得了一种不会误伤真实访客的控制手段。相比十年来盲目封禁 IP 段的做法,这显然更进一步。

它做不到的是阻拦恶意行为。基于自主声明意图的系统只能对主动声明的流量进行分类。其余所有流量都会回退到既有的检测技术栈中,而该技术栈正变得越来越敏锐:Cloudflare 的 会话级行为评分 在新分类推出十二天后便已上线。

因此两者并不冲突。身份验证负责筛选诚实流量,检测机制处理其余流量,如果你从不声明任何信息,你的流量默认就会落入第二种机制。

公开数据采集无处安放

现在来看看足以困扰任何数据采集管道运营者的问题。

以我们今年发布的工作为例。基于公开挂牌信息构建的 木材价格指数。跨六个市场的 MAP 违规检测,这意味着需要从六个不同的视角抓取同一商品页面并比对内容。应用商店排名与评论情绪分析。从广告实际购买投放的国家/地区执行的广告展示位检查。

把这些归类到 Search、Agent 还是 Training 中?

Search 不适用:Cloudflare 自身的定义附带了“作为回报带来推荐流量或其他等价补偿”的预期,而夜间价格检查不会给任何人带去推荐流量。Agent 也不适用,因为没有人在屏幕前等待该抓取结果。Training 显然更不对,因为没有任何数据会被吸收到模型中。

这是一套用来描述过去三年中出现的 AI 流量的分类法,现在却被套用在一个早于它十年就存在的业务上。价格情报、另类数据、SERP 追踪、品牌保护、广告验证、合规监控:这些都不是新事物,都不是 Agent 模式,也没有任何对应的选项可供勾选。

没有明确分类的流量,会由画定分类的人来归类。通常会被塞进最相近的那一类。

这对数据团队意味着什么

在规则尚未定型前,有四件事值得去做。

确定你真正能认同的类别。 不是为了蒙混过关而选的类别,而是当发布商直接询问时,你愿意书面辩护的类别。如果诚实的答案是“都不属于”,那么在分类体系固化时,你的业务承受的潜在损失最大;而在当前仍有讨论余地时表明立场,你能获得的益处也最多。

关注目标的具体设置,而非新闻头条。 站点的 Bot 策略现在属于该站点自身的属性,可以按路径配置,并且随时可能变更。如果把“Cloudflare 在 9 月封禁 Agent”当作影响你整个数据管道的既定事实,会导致你去重构那些根本未受威胁的部分。

假定广告页面测试会扩散。 Cloudflare 将其默认策略与展示广告的页面挂钩,这是判断“该页面通过人类注意力变现”的一个合理代理指标。这一界限会发生移动,且 Cloudflare 并不是唯一划定界限的服务商。AWS WAF 于 2026 年 6 月 15 日推出了 AI traffic monetization,返回 402 状态码及机器可读的支付条款。Akamai 则选择了与 TollBit 和 Skyfire 合作的路线。三大主要边缘计算服务商现在都提供相同的控制界面,我们在 按次抓取付费上线时从定价角度对其进行了分析。

确保你的采集系统在两条路径上都能运作。 实名路径(签名、声明、获得放行或接受计费)与匿名路径(一如既往地根据行为进行判定)将在未来数年共存。无论偏向哪一边,只按其中一种模式构建系统都会带来高昂的代价。

分类必将被重新划定

我们敢于做出一个明确预测:第四个类别将在一年内出现。

任何分类标准的初版都是由承受压力的一方制定的,而在制定过程中,被分类的对象往往并不在场。Search、Agent 和 Training 描述的是 AI 公司对内容发布方所做的事情。它们无法涵盖市场研究公司、合规团队或监控竞品货架价格的零售商,而在“Agent”在这个领域产生具体含义之前,这三类主体就一直在规范地抓取公开页面。

关于第四个分类框该如何命名、以及谁有权勾选它的争论,对数据行业的影响将远超今年发布的任何 Bot 检测基准测试。这场博弈值得全力以赴。

因为退路显而易见。如果你的流量无法自我定义,别人就会替你定义。