← Wszystkie wpisy

Pozew Google przeciwko SerpApi: weryfikacja botów nie jest sednem sprawy

Dwa sądy, jedna weryfikacja botów Google i sprzeczne wyroki w odstępie jedenastu dni. Pozew Google przeciwko SerpApi pokazuje, co ma teraz decydujące znaczenie: czyje treści znajdują się za zabezpieczeniem.

Jedna weryfikacja bota, dwa sądy, przeciwne wyroki

W odstępie jedenastu dni tego lata dwóch sędziów federalnych przyjrzało się tej samej weryfikacji botów Google, temu samemu pozwanemu i temu samemu rodzajowi roszczeń. Wydali całkowicie odmienne orzeczenia.

20 lipca 2026 r. główna sędzia Yvonne Gonzalez Rogers z sądu Northern District of California odrzuciła roszczenia Google z tytułu DMCA przeciwko SerpApi, firmie sprzedającej wyniki Google przez API. 31 lipca sędzia Paul Engelmayer z sądu Southern District of New York w przeważającej części odrzucił wnioski SerpApi i Perplexity o oddalenie pozwu Reddita, opartego na tym samym systemie Google.

Sprawa Sąd Data orzeczenia Roszczenia DMCA
Google v. SerpApi N.D. California 20 lipca 2026 Odrzucone
Reddit v. SerpApi S.D. New York 31 lipca 2026 W większości podtrzymane

Pozew Google przeciwko SerpApi trafił na pierwsze strony gazet, a większość relacji podsumowała lipiec jako jedną wygraną i jedną przegraną dla scraperów. My oceniamy to inaczej. O odmiennych wynikach nie zadecydowało samo ominięcie weryfikacji. Zadecydowało to, co znajdowało się za zabezpieczeniem i kto posiada do tego prawa. Dla każdego, kto zbiera dane z sieci, jest to znacznie bardziej użyteczna reguła niż nagłówki prasowe.

Jak SearchGuard wygląda po stronie odbiorcy

SearchGuard to mechanizm JavaScript challenge wdrożony przez Google w wyszukiwarce w styczniu 2025 r. Według samego Google zapytanie z nierozpoznanego źródła otrzymuje kod do wykonania. Przeglądarka użytkownika odpowiada w tle, podczas gdy większość zautomatyzowanych klientów nie jest w stanie tego zrobić i otrzymuje odmowę.

Sami się z tym spotykamy. W testach przeprowadzonych 17 września 2026 r. Google Search odpowiadało na niektóre zautomatyzowane żądania stroną o rozmiarze 92 KB zatytułowaną po prostu "Google Search": HTTP 200, brak wyników i monit o włączenie JavaScript. Zabezpieczenie Reddita wygląda na poziomie sieci bardzo podobnie (kod 200 zatytułowany "Reddit - Prove your humanity"). Każdy system oceniający sukces wyłącznie na podstawie kodu statusu zarejestruje obie odpowiedzi jako pomyślnie dostarczone strony.

Oto kwestia, która umknęła w nagłówkach. Sędzia Gonzalez Rogers nie uznała wcale, że SerpApi nie omijało SearchGuard. Orzekła, że Google odpowiednio uzasadniło roszczenie na podstawie sekcji 1201 DMCA, i odrzuciła argument SerpApi, według którego Google jako podmiot niebędący właścicielem praw nie mogło w ogóle złożyć pozwu. Mimo to Google przegrało.

Co to oznacza: sądy nie traktują pytania "czy ominąłeś zabezpieczenie?" jako kwestii rozstrzygającej. Traktują je dopiero jako punkt wyjścia.

Dlaczego Google przegrało, a Reddit nie

Sekcja 1201 DMCA zabrania omijania zabezpieczeń kontrolujących dostęp do „dzieła chronionego na mocy niniejszego tytułu”, co oznacza dzieło chronione prawem autorskim. Sam pozew Google opisywał wyniki wyszukiwania jako kompilacje informacji publicznych, z Panelami Wiedzy, które „mogą zawierać pewne treści chronione prawem autorskim”. Sąd w postanowieniu potraktował słowa Google dosłownie: „W zakresie, w jakim wyniki wyszukiwania Google Search nie zawierają żadnych treści chronionych prawem autorskim, nie można uznać, że SearchGuard skutecznie kontroluje dostęp do dzieła chronionego na mocy Copyright Act”. Ta część sprawy została odrzucona bez prawa do wniesienia poprawionego pozwu.

Część dotycząca Paneli Wiedzy nie przeszła drugiego testu. Środek zabezpieczający musi działać „za zgodą właściciela praw autorskich”, a Google nie przedstawiło ani jednego warunku licencji stojących za tymi obrazami. Google zarządza bramką. Nie jest właścicielem większości tego, co znajduje się za nią.

Reddit znajduje się w innej sytuacji. Posty jego użytkowników są chronione prawem autorskim, a regulamin serwisu daje Redditowi licencję na wszystkie z nich. Sędzia Engelmayer podtrzymał zarzuty z sekcji 1201(a)(1)(A) przeciwko obu pozwanym oraz z sekcji 1201(a)(2) przeciwko SerpApi, odrzucając jednocześnie zarzut z 1201(b) oraz stanowe roszczenia dotyczące bezpodstawnego wzbogacenia i nieuczciwej konkurencji. Ta sama weryfikacja, ale ten powód miał prawa do treści, które chronił. Sąd pozostawił otwartą kwestię, czy krótkie fragmenty (snippets) pojawiające się na stronach Google w ogóle podlegają ochronie, a Oxylabs, również wymieniony w pozwie, nadal czeka na rozpatrzenie własnego wniosku o odrzucenie pozwu.

Licencja staje się zamkiem

Google zrozumiało aluzję. Jego poprawiony pozew, złożony 10 sierpnia, opiera sprawę na umowach. Twierdzi w nim, że licencjodawcy autoryzowali kontrolę dostępu, „a w niektórych przypadkach wręcz nalegali, aby Google ją wdrożyło”. Wskazuje, że jeden z nienazwanych partnerów od 2017 roku zobowiązuje Google do „podjęcia uzasadnionych handlowo starań w celu ochrony licencjonowanych treści przed nieautoryzowanym dostępem osób trzecich”, a umowa z Reddit „zobowiązuje Google do uniemożliwienia podmiotom trzecim pobierania i samodzielnej komercjalizacji licencjonowanych treści”. Wskazuje nawet na własną Politykę Prywatności Google jako źródło upoważnienia od użytkowników.

Drugi wniosek SerpApi o odrzucenie pozwu odpowiada, że żadna z tych umów nie została faktycznie przedstawiona sądowi, a „zapis zabraniający pobierania nie jest zapisem zabraniającym dostępu”. 15 września sędzia odrzucił wniosek SerpApi o zobowiązanie Google do przedstawienia licencji. Zgodnie z aktami sprawy posiedzenie w sprawie samego wniosku wyznaczono na 13 października 2026 roku.

Naszym zdaniem październikowe orzeczenie ma mniejsze znaczenie niż schemat postępowania, który już wyznaczyło. Klauzula nakazująca licencjobiorcy ochronę treści przed nieautoryzowanym dostępem była dotąd standardową formułką. Po tym lecie stała się brakującym elementem w pozwach o odszkodowania ustawowe w wysokości od 200 do 2500 USD za każde naruszenie. Należy się więc spodziewać, że każda umowa dotycząca treści zawierana od teraz będzie ją zawierać, w tym porozumienia o płatnym dostępie, które zaczęły powstawać wokół modelu pay-per-crawl.

Kwestia kont nigdy nie budziła wątpliwości

Jeden aspekt tej sprawy w ogóle się nie zmienił. W połowie września sędzia federalny z Kalifornii zatwierdził ugodę sądową (consent judgment) między LinkedIn a ProAPIs oraz partnerem tej firmy, Netswift: zakaz scrapingu, zakaz sprzedaży lub przekazywania danych, zakaz korzystania z fałszywych kont, nakaz usunięcia pobranych zasobów. W pozwie LinkedIn opisał miliony fałszywych kont tworzonych w setkach lub tysiącach dziennie.

Zarzuty te dotyczyły właśnie kont, a nie samego omijania zabezpieczeń. Rezultat był bezwzględny: brak dostępu, brak odsprzedaży, brak danych.

Co to oznacza dla zespołów inżynierii danych

Jesteśmy inżynierami, a nie prawnikami, a oba lipcowe orzeczenia zapadły na etapie wniosków o odrzucenie pozwu (motion to dismiss), a nie podczas właściwego procesu. Poniższy tekst należy traktować jako przegląd kierunku, w którym zmierza argumentacja, a konkretne wątpliwości skonsultować z działem prawnym.

  1. Podziel cele scrapingu według rodzaju zachowywanych danych. Ceny, stany magazynowe, pozycje w rankingach, linki i ogłoszenia to fakty. Posty, recenzje, artykuły, zdjęcia i teksty utworów to formy ekspresji. Trwała część nakazu z 20 lipca dotyczy tej pierwszej kategorii, natomiast sprawa Reddita dotyczy tej drugiej.
  2. Źródło pobrania nie czyści praw do treści. Roszczenia Reddita, które pozostały w mocy, dotyczą postów rzekomo pobranych ze stron wyników Google, a nie bezpośrednio z reddit.com. Pozyskiwanie treści użytkowników za pośrednictwem wyszukiwarki nie eliminuje roszczeń ich właściciela.
  3. Własne zabezpieczenia właściciela to silny argument prawny. Słabością Google było kontrolowanie dostępu do cudzej pracy. Wydawca, który posiada prawa do swoich artykułów i wdrożył system antybotowy w celu ich ochrony, nie ma tego problemu. Jak wynika z raportu Zyte State of Web Access 2026, 18,5% czołowych witryn korzysta z dedykowanych usług detekcji botów, każda z własnego wyboru.
  4. Policz miejsca wymagające logowania. Jeśli jakikolwiek etap Twojego pipeline'u wymaga zalogowania, to właśnie tam kumuluje się ryzyko prawne, niezależnie od ostatecznych decyzji sądów w sprawie zabezpieczeń antybotowych.
  5. Uwzględnij w budżecie utrudnienia techniczne, których żaden sąd nie usunie. Google potwierdziło 26 sierpnia, że linki z wyników wyszukiwania przechodzą teraz przez przekierowanie google.com/goto. Derek Perkins z Nozzle poinformował, że linków nie da się zdekodować lokalnie, a rozwiązanie pozycji z pięciu stron wymaga od 500 do 1000 żądań. Dodajmy do tego usunięcie parametru num=100 z września 2025 roku (co oznaczało to dla monitorowania pozycji) i pozyskiwanie danych z wyszukiwarki podrożało dwukrotnie, bez żadnego udziału sądu.

Od kodu do umów

Przez lata spór o scraping dotyczył tego, czy weryfikacja botów liczy się jako zamek. Odpowiedź z tego lata jest bardziej precyzyjna niż proste tak lub nie: może się liczyć, jeśli zamek należy do właściciela zawartości lub do kogoś, kogo upoważnił na piśmie.

To przenosi walkę z działów inżynieryjnych do działów licencjonowania. Dodajmy do tego ruch Cloudflare, aby sortować ruch botów według deklarowanego celu, a kierunek staje się jasny: o dostępie decyduje to, kim jesteś i co podpisałeś, a coraz mniej to, jak wyglądają Twoje requesty.

Jeśli zbierasz publiczne fakty, lipiec rozjaśnił Twoją sytuację. Jeśli zbierasz cudze słowa przez cudzą bramkę, obrona takiego działania stała się właśnie znacznie trudniejsza.