同样的 Bot 验证,两个法庭,截然相反的判决
今年夏天,相隔仅 11 天,两位联邦法官审理了涉及同一套 Google Bot 验证机制、同一被告以及同类诉求的诉讼。他们给出了完全相反的裁决。
2026 年 7 月 20 日,加利福尼亚北区联邦地区法院首席法官 Yvonne Gonzalez Rogers 驳回了 Google 对 SerpApi 的 DMCA 诉讼请求。SerpApi 是一家通过 API 销售 Google 搜索结果的公司。7 月 31 日,纽约南区联邦地区法院法官 Paul Engelmayer 则基本驳回了 SerpApi 和 Perplexity 针对 Reddit 诉讼提出的撤案动议,而该案同样基于这套 Google 防护系统。
| 案件 | 法院 | 裁决时间 | DMCA 诉求 |
|---|---|---|---|
| Google v. SerpApi | 加利福尼亚北区 | 2026 年 7 月 20 日 | 驳回 |
| Reddit v. SerpApi | 纽约南区 | 2026 年 7 月 31 日 | 大部分保留 |
Google 与 SerpApi 的诉讼登上了新闻头条,多数报道将 7 月的裁决归结为爬虫方的一胜一负。我们的解读有所不同。决定两案不同结果的并不是是否绕过了验证机制。关键在于验证机制背后保护的内容是什么,以及谁拥有这些内容的权利。对于任何从事网络数据采集的人来说,这比媒体头条更有参考价值。
客户端视角下的 SearchGuard
SearchGuard 是 Google 于 2025 年 1 月在搜索服务前部署的 JavaScript 质询机制。按照 Google 自己的说法,来自未识别来源的查询会触发一段待执行的代码。人类用户的浏览器会在无感知的情况下完成响应;大多数自动化客户端则无法执行,从而被拒绝访问。
我们在实际测试中也遇到了这种情况。在 2026 年 9 月 17 日的测试中,Google 搜索对部分自动化请求返回了一个大小为 92 KB、标题仅为 "Google Search" 的页面:HTTP 状态码为 200,无搜索结果,并提示启用 JavaScript。从网络传输层面来看,Reddit 自有的防护页面也非常相似(状态码 200,标题为 "Reddit - Prove your humanity")。任何仅通过状态码判断请求成功的系统,都会将这两者记录为正常交付的页面。
以下是头条新闻中被忽略的核心细节。Gonzalez Rogers 法官并没有认定 SerpApi 未曾绕过 SearchGuard。她认定 Google 已经充分主张了 DMCA 第 1201 条的诉求,并驳回了 SerpApi 提出的 Google 作为非版权所有者完全无权起诉的抗辩。但 Google 最终依然败诉了。
**这意味着:**法院并未将“你是否绕过了验证”视为决定性问题。他们将其视为审理的起点。
为什么 Google 败诉而 Reddit 没有
DMCA 第 1201 条禁止规避用于控制访问“受本法保护之作品”(即受版权保护的作品)的技术措施。Google 自己的诉状将搜索结果描述为公开信息的汇编,并称知识面板(Knowledge Panels)“可能包含部分受版权保护的内容”。法院判决采信了 Google 自己的表述:“鉴于 Google Search 结果不包含任何受版权保护的内容,不能认定 SearchGuard 有效控制了对受《版权法》保护作品的访问。”该案的这部分诉求被驳回,且不准修正。
涉及知识面板的另一半诉求未能通过第二项审查。技术措施的运行必须“获得版权所有者的授权”,而 Google 没有在诉状中提出涉及这些图片的任何许可条款。Google 掌管着这扇门,但门后的大部分内容并不属于它。
Reddit 的情况则有所不同。其用户的帖子受版权保护,且用户协议赋予了 Reddit 对所有这些内容的许可权。Engelmayer 法官支持了针对两名被告依据第 1201(a)(1)(A) 条提出的主张,以及针对 SerpApi 依据第 1201(a)(2) 条提出的主张,同时驳回了第 1201(b) 条的主张以及州法层面的不当得利和不正当竞争指控。同样的法律检验,但该原告对其防护的内容拥有权利。法院并未判定出现在 Google 页面上的简短摘要(snippets)是否受到保护,同案被告 Oxylabs 提出的驳回起诉动议也仍在审理中。
许可协议正在变成数字锁
Google 心领神会。其于 8 月 10 日提交的 修正诉状将诉讼重点重建于合同之上。诉状称许可方授权了访问控制,“在某些情况下甚至坚持要求 Google 采取此类措施”。诉状指出,某未具名合作伙伴自 2017 年起就要求 Google“采取商业上合理的努力,保护受许可内容免遭未经授权的第三方访问”,并且与 Reddit 的协议“指示 Google 不得允许第三方提取受许可内容并进行独立商业化”。它甚至将 Google 自身的隐私权政策列为来自用户的授权依据。
SerpApi 的 第二次驳回起诉动议回应称,这些协议均未实际呈交法庭,并且“禁止下载条款并非禁止访问条款”。9 月 15 日,法官驳回了 SerpApi 强制 Google 提供许可协议的请求。根据 诉讼案卷,该动议本身的听证会定于 2026 年 10 月 13 日举行。
我们认为 10 月份的裁决本身并不重要,重要的是它所确立的操作范式。要求被许可方保护内容免遭未授权访问的条款,过去只是格式条款。在今年夏天之后,它成为了索赔每次侵权 200 至 2,500 美元法定赔偿金的关键要件。因此,预计从现在起签署的每一份内容协议都会包含此类条款,包括围绕 pay-per-crawl 形成的付费访问安排。
账号问题从来都不是悬而未决的争议
这一领域的情况完全没有改变。9 月中旬,一位加州联邦法官批准了 LinkedIn 与 ProAPIs 及其合作伙伴 Netswift 之间的 同意判决:停止抓取,停止销售或传输数据,停止使用虚假账号,并删除已获取的内容。LinkedIn 的诉状指控对方使用了数以百万计的虚假账号,每天新建的账号达数百或数千个。
这些指控的核心在于账号问题,而不是绕过验证机制。处理结果也很彻底:禁止访问、禁止转售、清除数据。
这对数据团队意味着什么
我们是工程师,不是律师,且 7 月份的两起裁决都发生在驳回起诉动议(motion-to-dismiss)阶段,而非庭审判决。请将以下内容视为法律争议演变方向的参考,具体问题请咨询法律顾问。
- 按保留的数据类型对目标进行分类。 价格、库存水平、排名、链接和列表属于事实信息。帖子、评论、文章、照片和歌词属于表达内容。7 月 20 日裁决中具有永久效力的部分涵盖了第一类;Reddit 案则属于第二类。
- 获取途径并不能洗白内容。 Reddit 仍保留的诉求涉及据称从 Google 搜索结果页面而非 reddit.com 获取的帖子。通过搜索中介抓取用户内容,仍会受到版权所有者的权利追索。
- 版权方自身的防护机制具有更强的法律效力。 Google 的劣势在于对其未拥有版权的内容设置了防护门槛。拥有自身文章版权并购买反爬产品进行防护的出版商则没有这一劣势。根据 Zyte 的《2026 年网络访问现状报告》,头部网站中有 18.5% 运行着专用的 Bot 检测服务,且均为自主选择部署。
- 清查涉及登录的环节。 如果你的数据流水线中任何一个步骤涉及登录,无论法院最终对 Bot 验证机制如何定性,那里都是你的法律风险集中点。
- 为法院无法消除的技术阻力预留成本。 Google 于 8 月 26 日确认,搜索结果链接现在会通过 google.com/goto 重定向。Nozzle 的 Derek Perkins 指出,这些链接无法在本地解码,解析一个 5 页的排名需要消耗 500 到 1,000 次 request。再加上 2025 年 9 月移除 num=100 参数的影响(这对排名追踪造成的影响),在没有任何司法干预的情况下,获取搜索数据的成本已经翻倍增加。
从代码到合同
多年来,关于抓取的争论一直在于 Bot 验证是否算作一把锁。今年夏天的答案比单纯的“是”或“否”更为明确:如果这把锁属于内容所有者,或者属于获得其书面授权的人,那么它就算作一把锁。
这意味着战局已从工程层面转移到了授权许可部门。再加上 Cloudflare 按声明用途对 Bot 流量进行分类的举措,大势已定:访问权限取决于你是谁以及你签署了什么协议,而与你请求的特征关系越来越小。
如果你采集的是公开事实数据,7 月份的进展让你的立场更加清晰。如果你是通过他人的关卡采集他人的文字内容,那么抗辩的难度刚刚大幅增加。