← 全部文章

机器人检测已转向行为分析。大多数爬虫却未跟上。

机器人检测已从封锁 IP 转向 TLS 指纹、浏览器信号和行为分析。大多数爬虫架构找错了应对方向。

1 月份的 1600 万次请求证明 IP 封锁已失效

2026 年 1 月,一起黄牛抢购攻击席卷了某大型电商平台。1600 万次请求分散在 390 万个独立 IP 地址中。基于单 IP 的 rate limit 对其毫无作用。该攻击能够得手并非由于代码精妙,而是庞大的 IP 规模让传统检测手段彻底失效 (SecurityBoulevard, March 2026)。

这一事件印证了 Bot 检测行业长期以来的观点:仅靠 IP 声誉已无法区分真人与 Bot。既然防御方已经升级策略,爬虫方案也必须同步演进。

取代 IP 封锁的三层防御体系

现代 Bot 检测运行在三个层级上,其中仅有第一层涉及 IP。

连接指纹识别。 在请求到达服务端之前,连接的首个数据包就带有独特的特征特征,用于识别发起请求的 HTTP 库。Python 的 requests 库、Go 的默认客户端、Node.js 的 fetch,各自都会生成截然不同的指纹。Bot 检测系统在读取任何 header 之前就会检查该特征。如果签名与真实浏览器不匹配,请求将在连接层直接被拦截 (Reddit r/programming)。

浏览器指纹识别。 目标站点现在会检查来自浏览器环境的 300 多个信号。Canvas 渲染、WebGL 输出、音频上下文、已安装字体、屏幕分辨率、时区、GPU 信息。User-Agent 字符串已是整个技术栈中最无关紧要的信号。Cloudflare、Akamai 和 DataDome 通过在页面加载前运行的 JavaScript challenge 被动采集这些数据。

行为分析。 这是最新的防御层,也是最难伪造的一层。Bot 检测系统现已开始追踪鼠标轨迹、滚动速度、点击模式、按键节奏以及交互间的时间间隔。真实人类移动鼠标绝非绝对直线,他们会停顿、划过按钮、不规则滚动。Bot 完全不会有这些行为,或者把这些行为模拟得过于完美 (r/webdev, 2026)。

多数爬虫团队在错误的战场发力

一个不争的事实是:多数爬虫团队仍将主要成本投入在 IP 基础设施上。扩充代理池、采购住宅 IP、轮换网关。这些固然有其价值,IP 声誉依然是诸多信号之一。

但如果连接层指纹直接暴露了 Python 脚本特征,或者 headless 浏览器通过 navigator.webdriver 泄露了自动化标记,购买 10,000 个住宅 IP 也无济于事。你把预算花在了错误的层级上。

一位构建了 34 个生产级爬虫的开发者曾写道(Dev|Journal,2026 年 3 月):教程级别的爬虫与生产环境中真正可用的方案之间的差距,在于 Bot 检测系统分析的是连接指纹和鼠标轨迹,而不是 DOM 选择器。教程教你如何解析 HTML。生产环境教你如何在检测中存活。

而且情况还在恶化。Browserless 的 State of Web Scraping 2026 报告指出,标准 headless 浏览器被标记的频率远高于真实浏览器,因为 Bot 检测系统已经归纳出 headless 与有头浏览器实例之间的具体指纹差异。这种差距并没有缩小。

如果 你的爬虫不断崩溃,而你只关注代理轮换,那么你可能完全找错了排查方向。

Cloudflare 因素

Cloudflare 值得特别提及,因为他们在这场转变中身兼两职。

他们的 Bot Management 产品对每个请求运行行为分析,根据数十个信号按 1 到 99 的分值对访问者进行评分。Turnstile(他们的隐式质询)会根据访问者看起来有多像真人来动态调整质询难度(Cloudflare 文档)。

与此同时,Cloudflare 推出了自己的 AI 抓取基础设施。社区也注意到了这种讽刺(Reddit r/cybersecurity)。

这在实际层面的含义是:受 Cloudflare 保护的网站在 2026 年是最难抓取的,而大约 20% 的网站都部署在他们的网络之后。如果你的爬取策略没有考虑行为检测,你就会失去五分之一的目标网络。

2026 年真正有效的方法

成功的爬虫具备三个共同特征。

第一,它们在报文层面上匹配最新浏览器的特征。连接的实际字节级特征必须与当前 Chrome 或 Firefox 会话发出的特征一致。任何程度的 header 伪造都无法解决连接指纹不匹配的问题。

第二,它们运行真实(或高度逼真)的浏览器环境。不是默认设置的 headless 实例。而是具有与声明的 User-Agent 相一致指纹的真实 浏览器实例。

第三,对于受保护的网站,它们会加入类似人类的行为噪点。仅靠随机延迟是不够的。操作之间的间隔需要符合真实的分布规律,鼠标移动轨迹需要具备自然的弧度和停顿。

因此架构已经发生了改变。重点不再是拥有更多 IP。而是让每一个请求都与真实用户在真实浏览器上的浏览行为毫无二致。

反爬虫检测对抗正在加速

Bot 检测厂商已开始在其实时客户网络中共享威胁情报。当一个站点标记了新的 Bot 行为特征时,网络中的其他所有站点都会在几分钟内同步获取(SecurityBoulevard,2026 年 3 月)。这与过去各站点防御各自为政的旧模式有着本质不同。

我们认为,这意味着自建爬虫基础设施的成本将持续攀升。每一个新的检测信号都需要投入工程时间来应对,而且这一迭代周期正在不断加快。在基础设施层处理检测问题(智能 proxy 路由、浏览器指纹伪装、连接层特征匹配)的团队,表现将远优于那些仅靠堆砌 IP 来解决问题的团队。

核心问题不在于你是否需要更多 proxy,而在于你的 request 在到达目标服务器之前,是否就已经具备了真实用户的特征。