← Tất cả bài viết

Vụ kiện giữa Google và SerpApi: Kiểm tra bot không phải là vấn đề cốt lõi

Hai tòa án, một cơ chế kiểm tra bot của Google, hai phán quyết trái ngược chỉ cách nhau 11 ngày. Vụ kiện giữa Google và SerpApi cho thấy yếu tố quyết định hiện nay: nội dung phía sau lớp kiểm tra thuộc về ai.

Cùng một cơ chế kiểm tra bot, hai tòa án, hai phán quyết trái ngược

Chỉ cách nhau 11 ngày trong mùa hè này, hai thẩm phán liên bang đã xem xét cùng một cơ chế kiểm tra bot của Google, cùng một bị đơn và cùng một loại khiếu nại. Phán quyết của họ hoàn toàn trái ngược nhau.

Vào ngày 20 tháng 7 năm 2026, Chánh án Yvonne Gonzalez Rogers thuộc Tòa án Quận Bắc California đã bác bỏ các khiếu nại DMCA của Google đối với SerpApi, công ty bán kết quả tìm kiếm của Google qua API. Vào ngày 31 tháng 7, Thẩm phán Paul Engelmayer thuộc Tòa án Quận Nam New York phần lớn đã bác bỏ các kiến nghị của SerpApi và Perplexity nhằm hủy bỏ vụ kiện của Reddit, vốn dựa trên chính hệ thống Google đó.

Vụ án Tòa án Phán quyết Khiếu nại DMCA
Google v. SerpApi N.D. California 20 tháng 7, 2026 Bác bỏ
Reddit v. SerpApi S.D. New York 31 tháng 7, 2026 Phần lớn được chấp thuận tiếp tục

Vụ kiện giữa Google và SerpApi đã chiếm trọn các dòng tít, và phần lớn các bài báo coi tháng 7 là một bàn thắng và một bàn thua cho giới scraping. Chúng tôi nhìn nhận vấn đề này theo cách khác. Vượt qua cơ chế kiểm tra không phải là yếu tố tạo ra hai kết quả khác nhau. Điều nằm sau cơ chế kiểm tra đó, và ai là người nắm giữ quyền sở hữu đối với nó, mới là mấu chốt. Đối với bất kỳ ai đang thu thập dữ liệu web, đó là một quy tắc hữu ích hơn nhiều so với bất kỳ dòng tít nào.

SearchGuard hiển thị như thế nào từ phía người nhận

SearchGuard là thử thách JavaScript mà Google đã đặt trước Search vào tháng 1 năm 2025. Theo chính Google, một truy vấn từ nguồn mà hệ thống không nhận diện sẽ nhận về mã để thực thi. Trình duyệt của người dùng thực phản hồi mà không ai nhận thấy; hầu hết các client tự động không thể làm được điều này và bị từ chối.

Bản thân chúng tôi cũng bắt gặp nó. Trong các thử nghiệm chúng tôi chạy vào ngày 17 tháng 9 năm 2026, Google Search đã phản hồi một số request tự động bằng một trang 92 KB chỉ có tiêu đề "Google Search": HTTP 200, không có kết quả, kèm theo thông báo yêu cầu bật JavaScript. Cổng chặn của chính Reddit nhìn từ tầng mạng cũng tương tự (một mã 200 có tiêu đề "Reddit - Prove your humanity"). Bất kỳ hệ thống nào đánh giá mức độ thành công dựa trên status code đều sẽ ghi nhận cả hai trường hợp này là các trang đã được phân phối thành công.

Đây là phần bị bỏ qua trên các mặt báo. Thẩm phán Gonzalez Rogers không kết luận rằng SerpApi chưa từng vượt qua SearchGuard. Bà phán quyết rằng Google đã cáo buộc đầy đủ khiếu nại theo Điều 1201 của DMCA, và bà bác bỏ lập luận của SerpApi cho rằng Google, với tư cách là bên không sở hữu quyền tác giả, không có quyền khởi kiện. Dù vậy, Google vẫn thua cuộc.

Điều này có ý nghĩa gì: các tòa án không xem "bạn có vượt qua được cơ chế kiểm tra hay không?" là câu hỏi mang tính quyết định. Họ chỉ xem đó là điểm bắt đầu.

Tại sao Google thua còn Reddit thì không

Mục 1201 của DMCA nghiêm cấm hành vi vượt qua biện pháp kiểm soát quyền truy cập vào "một tác phẩm được bảo vệ theo tiêu đề này", nghĩa là tác phẩm có bản quyền. Đơn khiếu nại của chính Google mô tả kết quả của họ là các bản tổng hợp thông tin công khai, với các Knowledge Panel "có thể chứa một số nội dung có bản quyền." Lệnh của tòa đã ghi nhận đúng nguyên văn của Google: "Trong chừng mực kết quả Google Search không chứa bất kỳ nội dung có bản quyền nào, SearchGuard không thể được coi là kiểm soát hiệu quả quyền truy cập vào tác phẩm được bảo vệ theo Đạo luật Bản quyền." Một nửa vụ kiện đó đã bị bác bỏ và không được phép sửa đổi bổ sung.

Nửa vụ kiện liên quan đến Knowledge Panel đã không vượt qua được bài kiểm tra thứ hai. Biện pháp kiểm soát phải hoạt động "dưới sự ủy quyền của chủ sở hữu bản quyền", và Google đã không đưa ra được điều khoản nào trong các thỏa thuận cấp phép đằng sau những hình ảnh đó. Google nắm giữ cổng kiểm soát. Họ không sở hữu hầu hết những gì nằm phía sau nó.

Reddit lại ở một vị thế khác. Các bài đăng của người dùng Reddit đều có bản quyền, và thỏa thuận người dùng cấp cho Reddit giấy phép đối với tất cả các bài đăng đó. Thẩm phán Engelmayer đã giữ nguyên các khiếu nại theo mục 1201(a)(1)(A) đối với cả hai bị đơn và theo mục 1201(a)(2) đối với SerpApi, đồng thời bác bỏ khiếu nại theo mục 1201(b) cùng các cáo buộc làm giàu bất chính và cạnh tranh không lành mạnh theo luật tiểu bang. Cùng một quy chuẩn kiểm tra, nhưng nguyên đơn này thực sự có quyền đối với nội dung mà họ bảo vệ. Tòa án vẫn để ngỏ khả năng liệu các đoạn trích ngắn (snippet) hiển thị trên các trang của Google có được bảo vệ hay không, và Oxylabs, cũng là bị đơn trong vụ kiện, vẫn đang chờ phán quyết cho đơn yêu cầu bác bỏ của riêng mình.

Giấy phép đang trở thành chiếc khóa

Google đã nhận ra vấn đề. Đơn khiếu nại sửa đổi của họ, nộp ngày 10 tháng 8, đã tái cấu trúc vụ kiện xoay quanh các hợp đồng. Đơn nêu rằng các bên cấp phép đã ủy quyền áp dụng các biện pháp kiểm soát quyền truy cập "và trong một số trường hợp còn yêu cầu Google phải làm như vậy." Đơn cũng nêu một đối tác giấu tên đã ràng buộc Google từ năm 2017 phải "sử dụng các nỗ lực hợp lý về mặt thương mại để bảo vệ nội dung được cấp phép khỏi sự truy cập trái phép của bên thứ ba", và thỏa thuận với Reddit "yêu cầu Google không cho phép các bên thứ ba trích xuất và thương mại hóa độc lập nội dung được cấp phép." Google thậm chí còn viện dẫn Chính sách quyền riêng tư của chính mình như một sự ủy quyền từ người dùng.

Đơn yêu cầu bác bỏ thứ hai của SerpApi phản bác rằng không có thỏa thuận nào trong số đó thực sự được trình lên tòa án, và "điều khoản chống tải xuống không phải là điều khoản chống truy cập." Vào ngày 15 tháng 9, thẩm phán đã từ chối yêu cầu của SerpApi về việc buộc Google phải xuất trình các giấy phép. Phiên điều trần về chính đơn yêu cầu bác bỏ này được ấn định vào ngày 13 tháng 10 năm 2026, theo thông tin trên hồ sơ vụ án.

Chúng tôi cho rằng phán quyết vào tháng 10 ít quan trọng hơn cẩm nang chiến lược mà nó đã vạch ra sẵn. Một điều khoản yêu cầu bên được cấp phép phải bảo vệ nội dung khỏi truy cập trái phép từng chỉ là văn bản mẫu mang tính thủ tục. Sau mùa hè này, đó lại là yếu tố còn thiếu trong yêu cầu bồi thường thiệt hại theo luật định từ 200 đến 2.500 USD cho mỗi vi phạm. Vì vậy, hãy lường trước rằng mọi thỏa thuận nội dung được ký kết từ nay về sau sẽ đều bao gồm điều khoản này, bao gồm cả các thỏa thuận truy cập trả phí bắt đầu hình thành xoay quanh pay-per-crawl.

Tài Khoản Chưa Bao Giờ Là Câu Hỏi Mở

Một khía cạnh của vấn đề này hoàn toàn không thay đổi. Vào giữa tháng 9, một thẩm phán liên bang tại California đã hoàn tất một phán quyết theo thỏa thuận giữa LinkedIn và ProAPIs, cùng với đối tác của họ là Netswift: ngừng scraping, ngừng bán hoặc chuyển giao dữ liệu, ngừng sử dụng tài khoản giả mạo, xóa bỏ những gì đã thu thập. Đơn khiếu nại của LinkedIn mô tả hàng triệu tài khoản giả mạo, với hàng trăm hoặc hàng nghìn tài khoản được tạo mới mỗi ngày.

Những cáo buộc đó tập trung vào các tài khoản, chứ không phải việc vượt qua một rào cản kiểm tra. Và kết quả là hoàn toàn triệt để: không truy cập, không bán lại, không dữ liệu.

Ý Nghĩa Đối Với Các Đội Ngũ Dữ Liệu

Chúng tôi là kỹ sư, không phải luật sư, và cả hai phán quyết vào tháng 7 đều diễn ra ở giai đoạn bác bỏ đơn kiện thay vì tại phiên tòa xét xử. Hãy xem nội dung sau đây như một bản đồ định hướng các lập luận pháp lý, và hãy chuyển các câu hỏi thực tế đến cố vấn pháp lý.

  1. Phân loại mục tiêu theo những gì bạn lưu giữ. Giá cả, lượng hàng tồn kho, thứ hạng, liên kết và danh sách niêm yết là các sự kiện thực tế. Bài đăng, đánh giá, bài viết, hình ảnh và lời bài hát là sự thể hiện mang tính sáng tạo. Phần vĩnh viễn của phán quyết ngày 20 tháng 7 áp dụng cho loại thứ nhất; vụ kiện Reddit nằm ở loại thứ hai.
  2. Lộ trình thu thập không làm sạch nội dung. Các khiếu nại còn tồn tại của Reddit liên quan đến các bài đăng được cho là đã lấy từ các trang kết quả của Google, không phải từ reddit.com. Việc thu thập nội dung người dùng thông qua một bên trung gian tìm kiếm vẫn mang theo khiếu nại của chủ sở hữu đi cùng.
  3. Cơ chế kiểm soát của chính chủ sở hữu là trường hợp pháp lý vững chắc. Điểm yếu của Google là vận hành một cổng kiểm soát đối với sản phẩm của người khác. Một nhà xuất bản sở hữu các bài viết của mình và mua một sản phẩm bot để bảo vệ chúng thì không có điểm yếu đó, và theo State of Web Access 2026 của Zyte, 18,5% các trang web hàng đầu sử dụng dịch vụ bot-detection chuyên dụng, mỗi trang web trong số đó đều tự nguyện lựa chọn.
  4. Đếm số lượng đăng nhập. Nếu bất kỳ bước nào trong pipeline của bạn thực hiện đăng nhập, đó là nơi tập trung rủi ro pháp lý của bạn, bất kể các phán quyết cuối cùng của tòa án về bot check như thế nào.
  5. Dự trù ngân sách cho những trở ngại mà không tòa án nào dỡ bỏ. Google đã xác nhận vào ngày 26 tháng 8 rằng các liên kết kết quả hiện chuyển hướng qua google.com/goto. Derek Perkins của Nozzle đã báo cáo rằng các liên kết không thể được giải mã cục bộ và việc xử lý thứ hạng của một trang gồm năm kết quả cần 500 đến 1.000 request. Cùng với việc loại bỏ num=100 từ tháng 9 năm 2025 (ảnh hưởng của điều đó đối với việc theo dõi thứ hạng), dữ liệu tìm kiếm đã trở nên đắt đỏ hơn gấp hai lần, mà không cần đến sự can thiệp của bất kỳ thẩm phán nào.

Từ Mã Nguồn Đến Hợp Đồng

Nhiều năm qua, tranh luận về scraping luôn xoay quanh việc liệu một lớp kiểm tra bot có được tính là khóa bảo vệ hay không. Câu trả lời trong mùa hè này rõ ràng hơn một chữ có hoặc không: có thể, khi khóa thuộc về chủ sở hữu nội dung bên trong, hoặc người được họ ủy quyền bằng văn bản.

Điều đó chuyển cuộc chiến từ kỹ thuật sang các bộ phận cấp phép. Cùng với động thái của Cloudflare trong việc phân loại lưu lượng bot theo mục đích khai báo, định hướng dường như đã rõ: quyền truy cập được quyết định bởi bạn là ai và bạn đã ký những gì, ngày càng ít phụ thuộc vào việc request của bạn trông như thế nào.

Nếu bạn thu thập dữ liệu thực tế công khai, tháng 7 đã làm rõ vị thế của bạn hơn. Nếu bạn thu thập câu chữ của người khác qua cánh cổng của bên thứ ba, việc biện minh vừa trở nên khó khăn hơn rất nhiều.