← 全部文章

Web Scraping 焦油坑:谁真正被困其中

网站正在部署焦油坑来诱捕 AI 爬虫并向其喂送垃圾数据。但这些陷阱无法区分 GPTBot 和你的价格追踪器。

网站正在为 AI 爬虫设置陷阱

一款名为 Nepenthes 的工具在 2025 年初迅速走红。它能生成无限循环的虚假网页迷宫,每个页面都链接到更多假页面,旨在将爬虫困在无法逃脱的死循环中。至于这些页面上的文本?全部是通过算法生成的乱码,专门用来向 AI 训练数据集注入垃圾数据。

Nepenthes 并非个例。像 Locaine 以及越来越多开源“焦油坑”(tarpits)项目接连在 GitHub 上涌现,它们的主张如出一辙:如果 AI 公司不遵守 robots.txt,网站所有者就会用毒化数据进行反击。

这种动机完全可以理解。arXiv 上的一项学术研究发现,知名网站中屏蔽 AI 的比例从 2023 年 9 月的 23% 激增至 2025 年 5 月的近 60%。BuzzStream 的分析显示,79% 的主流新闻网站现在通过 robots.txt 屏蔽 AI 训练爬虫。Cloudflare Radar 的报告也指出,2025 年年中 75% 的 AI 相关网络流量来自训练需求,而非搜索或推理。

但焦油坑不会验证身份。它们不会询问你的爬取目的。只要看起来像自动化程序,它们一律设套拦截。

究竟是谁被困住了

预期的目标显而易见:GPTBot、ClaudeBot 以及那些为获取训练数据而在开放网络上搜集内容的 AI 公司爬虫。问题在于,焦油坑无法区分 OpenAI 的爬虫和你的价格监控脚本。

焦油坑通过检测自动化 request 模式来工作。如果你的爬虫按固定模式跟踪链接、以固定间隔访问页面,或者跳过 JavaScript 执行(大多数 AI 训练爬虫的运作方式),它就会被判定为目标。陷阱根本不在乎你只是一个监测竞品价格的 10 人电商团队。它只要识别出类似 bot 的流量特征,就会开始返回虚假页面。

这不仅是理论推演。来自罗格斯大学和沃顿商学院的研究发现,屏蔽 AI 爬虫的网站总流量下降了 23.1%,真实人类流量也下降了 13.9%。激进的屏蔽策略不仅拦住了 AI 爬虫,同时也损害了网站自身的曝光度。

而焦油坑的手段更为彻底:它们会主动消耗爬虫的算力、存储和带宽,同时喂给它垃圾数据,污染其正在构建的模型或数据库。

对抗升级路径

Robots.txt 从来都只是一项君子协定。只要大家都遵守规则,它就能奏效。当头部 AI 公司开始忽视它(或者对“用于搜索的爬取”与“用于训练的爬取”进行随意曲解)时,网站所有者便开始升级对抗手段。

演变模式大致如下:

  1. Robots.txt 拦截: 礼貌的请求
  2. User-Agent 过滤: 拦截已知的 AI 爬虫特征
  3. 行为检测: 通过请求模式捕获未知爬虫
  4. Tarpit: 消耗资源并污染数据的主动对抗措施

每一步都能捕获更多威胁。每一步也都会误伤更多合法流量。到了第四步,系统会将所有自动化访问视为恶意行为。因此,为比价服务抓取公开产品价格的爬虫,会触发与未经许可抓取数据的 GPTBot 相同的陷阱。

数据团队当下该做什么

如果你正在进行任何规模化的数据采集,tarpit 已经改变了游戏规则。以下几点比以往任何时候都更重要。

始终遵守 robots.txt。 这听起来很基础,但现在已是基本准入门槛。网站将 robots.txt 作为初筛手段。一旦忽视它,你就会被归类为引发这一整套 tarpit 防御措施的 AI 训练爬虫。

避免表现得像训练爬虫。 AI 训练爬虫具有可预测的特征:抓取所有链接、批量请求页面、跳过 JavaScript 并保持固定的请求间隔。如果你的爬虫也是这样运作的,行为检测就会发出告警。改变请求时序。只加载必要的内容。在网站需要时执行 JavaScript。我们在 Why Your Web Scraper Keeps Breaking 中分析过导致爬虫被封禁的原因。

校验传入的数据。 Tarpit 会返回看似合理但毫无意义的垃圾数据。如果你没有在流水线中检查响应内容,就可能会将马尔可夫链生成的文本作为真实产品描述存入数据库。应将校验作为核心步骤构建,而不是事后补救。

投资你的请求基础设施。 旧的应对方案(轮换 IP、失败重试)已经不够用了。现代反爬系统会分析 TLS 指纹、浏览器行为和会话模式。智能 proxy 路由 有所帮助,但真正的转变是从 IP 级别检测升级到行为级别检测。如果你抓取的是重度依赖 JavaScript 的网站,基于浏览器的采集 正日益成为唯一可靠的方法。

访问鸿沟正在扩大

我们认为网络生态正走向明显的分化。一方面:网站通过付费访问协议、API 合作和授权抓取来实现数据变现。另一方面:网站将所有自动化访问视为威胁,并部署愈发激进的防御手段。

对于数据团队来说,这意味着采集成本将持续上升。这不是因为技术更难构建,而是因为网络环境变得更加恶劣。那些投资于负责任、透明抓取实践的团队将保住访问权限。而那些看起来像训练爬虫的抓取程序,则会被诱入陷阱、污染数据并最终遭到封锁。

网络焦油坑(tarpits)不会消失。对于你的团队而言,关键不是要不要担心它们,而是你的基础设施能否在数据写入数据库之前,分辨出真实页面与陷阱之间的差异。