全部文章

机器人检测已转向行为分析。大多数爬虫却未跟上。

机器人检测已从封锁 IP 转向 TLS 指纹、浏览器信号和行为分析。大多数爬虫架构找错了应对方向。

一月份的1600万次 request 证明 IP 封锁已死

2026年1月,一次黄牛攻击袭击了一家大型电商平台。1600万次 request 分布在390万个独立的 IP 地址上。基于 IP 的 rate limit 对此毫无办法。这次攻击成功并不是因为代码巧妙。它成功是因为庞大的 IP 数量让传统的检测毫无意义(SecurityBoulevard, 2026年3月)。

该事件证明了反机器人行业一直以来的观点:仅靠 IP 信誉无法区分人类和机器人。如果防御者已经升级,爬虫也必须随之升级。

取代 IP 封锁的三个层级

现代机器人检测在三个层级上运行。只有第一层涉及你的 IP。

连接指纹。 在 request 到达服务器之前,连接的第一个数据包带有独特的特征,可以识别发出 request 的 HTTP 库。Python 的 requests 库、Go 的默认客户端、Node.js fetch,每个都会产生不同的指纹。反机器人系统在读取任何 header 之前就会检查这一点。如果你的签名与真实的浏览器不匹配,你将在连接层被阻止(Reddit r/programming)。

浏览器指纹。 网站现在会检查来自浏览器环境的300多个信号。Canvas 渲染、WebGL 输出、音频上下文、已安装的字体、屏幕分辨率、时区、GPU 信息。你的 User-Agent 字符串是堆栈中最不重要的信号。Cloudflare、Akamai 和 DataDome 通过在页面加载前运行的 JavaScript 质询被动收集这些信息(ScrapingBee, 2026)。

行为分析。 这是最新的层级,也最难伪造。反机器人系统现在追踪鼠标移动、滚动速度、点击模式、打字节奏以及交互之间的时序。真人不会以完美的直线移动鼠标。他们会停顿、划过按钮、不规则地滚动。机器人不会做这些,或者做得过于完美(r/webdev, 2026)。

大多数爬虫团队找错了方向

一个令人不安的事实是:大多数爬虫团队仍主要投资于 IP 基础设施。更大的 proxy 池、住宅 IP、轮换网关。这些仍有其用武之地。作为众多信号之一,IP 信誉依然重要。

但如果你的连接层指纹明显是“Python 脚本”,或者你的 headless 浏览器通过 navigator.webdriver 泄露了自动化标志,那么购买一万个住宅 IP 也无济于事。你把钱花在了错误的层级上。

一位构建了34个生产级爬虫的开发者写到了这个问题(Dev|Journal, 2026年3月):教程级爬虫与生产环境中可用的爬虫之间的差距,是由分析连接指纹和鼠标移动的反机器人系统决定的,而不是 DOM 选择器。教程教你解析 HTML。生产环境教你在检测中存活。

情况正变得更糟。Browserless 的 2026年网络爬虫现状报告发现,标准 headless 浏览器比真实浏览器更容易被标记,因为反机器人系统已经编录了 headless 浏览器与正常浏览器实例之间的具体指纹差异。这种差距并没有缩小。

如果 你的爬虫不断崩溃 且你只关注 proxy 轮换,你可能完全修错了地方。

Cloudflare 因素

Cloudflare 值得特别提及,因为他们同时处于这种转变的双方。

他们的 Bot Management 产品对每个 request 运行行为分析,基于数十种信号对访问者进行 1-99 的评分。Turnstile(他们不可见的 CAPTCHA 替代品)根据访问者看起来有多像人类来动态调整质询难度(Cloudflare 文档)。

同时,Cloudflare 推出了自己的 AI 爬取基础设施。社区注意到了这种讽刺(Reddit r/cybersecurity)。

实际意义是:受 Cloudflare 保护的网站在2026年最难抓取,大约有20%的网站位于其网络后端。如果你的抓取策略没有考虑行为检测,你已经失去了五分之一的可用网络。

2026年真正有效的方法

成功的爬虫具有三个特征。

首先,它们匹配最新浏览器的传输层签名。连接的实际字节级特征必须与当前 Chrome 或 Firefox 会话发出的特征一致。任何 header 欺骗都无法修复不匹配的连接指纹。

其次,它们运行真实的(或令人信服的)浏览器环境。不是默认设置的 headless 实例。而是实际的 浏览器实例,具有一致的指纹,与它们声明的 User-Agent 相匹配。

第三,对于受保护的网站,它们会加入类似人类的行为噪声。仅靠随机延迟是不够的。操作之间的时序需要遵循真实的分布,鼠标移动路径需要有看起来自然的曲线和停顿。

因此,架构已经发生了转变。这不再是关于拥有更多的 IP。而是让每个 request 都与使用真实浏览器的真人无法区分。

检测军备竞赛正在加速

反机器人供应商已经开始在其客户群中实时共享威胁情报。当一个网站标记了一种新的机器人模式时,网络中的所有其他网站都会在几分钟内获知该模式(SecurityBoulevard, 2026年3月)。这是旧模型的根本性改变,旧模型中每个网站的防御都是独立运行的。

我们认为这意味着自建爬虫基础设施的成本将不断攀升。每一个新的检测信号都需要投入工程时间来应对,而且这个周期正在加速。在基础设施层面处理检测的团队(智能 proxy 路由、浏览器指纹、连接层匹配)的表现将优于那些只依靠增加 IP 数量的团队。

问题不在于你是否需要更多的 proxy。而在于你的 request 在到达目标服务器之前看起来是否像人类。