连接层信号是 Bot 检测的基线
98.6%。
这是一个 CatBoost 模型仅使用连接层特征达到的分类准确率。没有请求头。没有 IP。没有行为分析。仅仅依据初始握手的特征结构。这篇 arXiv 论文发表于 2026 年 2 月,这一结果并非特例。Cloudflare、AWS、VirusTotal 以及 Akamai 均已在生产环境中运行连接层指纹识别。如果你在 2026 年仍在使用普通 HTTP 客户端进行爬取,在你的请求到达应用层之前,判定结果就已经确定了。
这是大多数 Bot 检测教程忽略的部分。大多数关于 Bot 检测的文章仍围绕 User-Agent 轮换、Cookie 和验证页面展开。这些都是较容易应对的层级。但连接层是你无法通过请求头来伪造的。
指纹实际检测的内容
连接层指纹是初始握手消息的哈希值。它对协议(TCP 或 QUIC)、版本、SNI 是否存在、密码套件排序、扩展、签名算法以及 ALPN 进行编码。声明为同一浏览器的两个客户端会生成相同的哈希值。而声明为 Chrome 的 Python requests 脚本所生成的指纹,在全世界除了爬虫之外根本不存在。
当前这代指纹解决了上一代指纹的最大弱点:扩展排列置换。主流浏览器在 2023 年引入了这一机制以破解早期的简单指纹识别。新设计对扩展进行了排序并计算数量,因此随机化已不再起作用。这里没有简单的规避手段。
Akamai 披露通过跨层分析实现了 92% 至 98% 的 Bot 分类准确率。跨层分析至关重要。连接层信号本身起主导作用,但将其与 HTTP/2 帧排序、Header 顺序以及请求时序相结合,可以将误报率降至大多数爬虫无法承受的水平。
后量子加密带来的转变
这是出乎所有人意料的部分。2026 年 1 月 31 日,Akamai 将后量子密钥交换设为所有连接的默认配置。到 2026 年初,由真实浏览器发起的连接中已有 57.4% 包含 X25519MLKEM768 密钥份额。Chrome 的后量子支持比例约为 93%。Firefox 为 85%。Safari 正在逐步推出。
后量子密钥份额体积很大。传统 X25519 仅需 36 字节,而它需要 1,124 字节。初始握手消息从 300 至 500 字节激增到超过 1,400 字节。这种增长直接反映在连接层指纹、数据包捕获以及 WAF 的被动观测中。
如果你的爬取客户端未包含后量子密钥份额,你的请求特征就会与当前任何 Chrome 或 Firefox 完全不符。2026 年第一季度的两个 CVE 明确指出了这种不匹配:CVE-2026-26995(填充扩展)每次请求带来 25% 至 50% 的检测概率,而 CVE-2026-27017(ECH 与 GREASE 不匹配)则在 50% 左右。在整个会话中叠加后,被识别的概率接近必然。
这是一个原本预计需要 12 个月、如今却缩短至 3 个月的问题。大多数开源爬取技术栈尚未支持兼容 PQ 的握手。而少数已经支持的,也比实际的浏览器版本落后数周。
为什么代理无法解决这个问题
业内流传着一种令人宽慰的说法,认为更大的代理池可以解决现代 Bot 检测。事实并非如此。Security Boulevard 报道的 2026 年 1 月黄牛抢购事件中,攻击者通过 390 万个独立 IP 发送了 1600 万次 request。基于单个 IP 的封禁完全失效。真正奏效的防御手段主要是连接层指纹和行为指纹。
住宅代理的经济模型也在本季度破裂。Help Net Security 在 2026 年 4 月报道,IPIDEA 网络在 1 月遭受的破坏导致整个行业的住宅代理容量在一夜之间下降了约 40%。与这一容量冲击相比,Bright Data 和 Oxylabs 的专利纠纷(最高法院于 2026 年 2 月 23 日驳回了 Bright Data 的上诉,审判定于 5 月 18 日)不过是一场旁支事件。试图通过购买住宅 IP 来对抗指纹识别的买家正在支付更高的成本,换来的却是一个 WAF 根本不在乎的方案。
代理依然重要,但原因并非大多数人所想。地理分布和 ISP 类型决定了路由策略和 rate limit 规则。它们无法帮助你在握手阶段幸存下来。
这对数据团队意味着什么
如果你在 2026 年构建或采购爬取基础设施,有三点会发生变化。
首先,连接层技术栈现在是一项硬性要求。任何无法匹配当前浏览器握手(PQ key share、扩展顺序、ALPN、签名算法)的客户端,都会生成一个被高置信度标记为 Bot 的指纹。仅用更好的 header 包装 Python requests 毫无作用。传输层才是破绽所在。
其次,针对 headless 浏览器的检测变得更加严苛,而非更宽松。Browserless 发布的 2026 年网页爬取现状报告指出,headless 与 headed 浏览器实例之间的差距正在拉大。Bot 检测厂商已经整理了指纹差异,并在客户站点之间近乎实时地共享威胁情报。一个在 12 月仍可正常工作的 headless 实例,到 5 月可能就会被归类为 Bot。行为信号叠加在传输层之上,并且两者都是动态变化的目标。
第三,自建与采购的成本权衡发生了变化。维护一个能够紧跟动态变化的连接签名(浏览器每隔几周就会发布 PQ 更新,扩展顺序在小版本之间变动,密码套件偏好也会调整)现在已成为一项全职工作。2024 年只需投入 0.2 个工程师人力的爬虫维护工作,到 2026 年需要占用半个以上的人力。我们之前 写过爬虫频繁失效的原因。在 2026 年,原因更多出在“传输层”而非“DOM”。
成本最低的爬虫是从不被归类为爬虫的爬虫
真正值得关注的预测,不是 Bot 拦截厂商是否会继续提高门槛。他们必然会这么做。真正值得关注的预测是,当 98% 的识别准确率成为行业基本门槛时,哪些爬取工具能够存活下来。
大多数工具会被淘汰。但能够存活下来的工具,都会将握手视为请求本身的一部分,而不是单纯的传输细节。采购方也将开始向供应商提出一个 12 个月前还未列入评估清单的问题:你们提供什么样的连接签名,更新频率有多快?
在请求尚未正式发送之前,握手阶段就已经决定了结果。