← Todos os posts

Ação Judicial da Google contra a SerpApi: A Verificação de Bot Não É a Questão

Dois tribunais, uma verificação de bot da Google, decisões opostas com onze dias de diferença. O processo entre Google e SerpApi mostra o que define isso agora: de quem é o conteúdo protegido pela verificação.

Uma verificação de bot, dois tribunais, respostas opostas

Com um intervalo de onze dias neste verão, dois juízes federais analisaram a mesma verificação de bot do Google, o mesmo réu e o mesmo tipo de alegação. Eles chegaram a conclusões opostas.

Em 20 de julho de 2026, a Juíza-Chefe Yvonne Gonzalez Rogers, do Distrito Norte da Califórnia, rejeitou as alegações de DMCA do Google contra a SerpApi, a empresa que vende resultados do Google por meio de uma API. Em 31 de julho, o Juiz Paul Engelmayer, do Distrito Sul de Nova York, negou em grande parte os pedidos da SerpApi e da Perplexity para rejeitar a ação do Reddit, que se baseia no mesmo sistema do Google.

Caso Tribunal Decisão Alegações de DMCA
Google v. SerpApi N.D. California 20 de julho de 2026 Rejeitadas
Reddit v. SerpApi S.D. New York 31 de julho de 2026 Mantidas em grande parte

O processo do Google contra a SerpApi ganhou as manchetes, e grande parte da cobertura considerou julho como uma vitória e uma derrota para scrapers. Interpretamos isso de forma diferente. Passar pela verificação não foi o fator que separou os dois resultados. O que estava por trás da verificação, e quem detém os direitos sobre isso, sim. Para quem faz coleta de dados na web, essa é uma regra muito mais útil do que qualquer manchete.

Como o SearchGuard se parece para quem recebe

O SearchGuard é o desafio em JavaScript que o Google colocou na Busca em janeiro de 2025. Segundo o próprio Google, uma consulta vinda de uma fonte não reconhecida recebe código para executar. O navegador de um usuário real responde sem que ninguém perceba; a maioria dos clientes automatizados não consegue e recebe uma recusa.

Nós mesmos encontramos isso. Em testes que realizamos em 17 de setembro de 2026, a Busca do Google respondeu a algumas requests automatizadas com uma página de 92 KB intitulada apenas "Google Search": HTTP 200, sem resultados e com um aviso para ativar o JavaScript. A barreira do próprio Reddit é muito parecida na rede (um 200 intitulado "Reddit - Prove your humanity"). Qualquer sistema que avalie o sucesso apenas pelo código de status registra ambos como páginas entregues.

Aqui está a parte que passou despercebida nas manchetes. A Juíza Gonzalez Rogers não concluiu que a SerpApi nunca contornou o SearchGuard. Ela considerou que o Google alegou adequadamente uma violação da Seção 1201 do DMCA e rejeitou o argumento da SerpApi de que o Google, por não ser o proprietário, não poderia processar. O Google perdeu de qualquer forma.

O que isso significa: os tribunais não estão tratando "você passou pela verificação?" como a pergunta decisiva. Eles estão tratando isso como o ponto de partida de uma.

Por que o Google perdeu e o Reddit não

A Seção 1201 da DMCA proíbe contornar uma medida que controla o acesso a "uma obra protegida sob este título", o que significa uma obra protegida por direitos autorais. A própria denúncia do Google descreveu seus resultados como compilações de informações públicas, com Painéis de Conhecimento que "podem conter algum conteúdo protegido por direitos autorais". A decisão levou o Google ao pé da letra: "Na medida em que os resultados do Google Search não contêm nenhum conteúdo protegido por direitos autorais, não se pode dizer que o SearchGuard controla eficazmente o acesso a uma obra protegida pela Lei de Direitos Autorais". Essa metade do caso foi arquivada sem permissão para emenda.

A parte referente aos Painéis de Conhecimento falhou em um segundo teste. A medida precisa operar "com a autorização do detentor dos direitos autorais", e o Google não apresentou nenhum termo das licenças por trás daquelas imagens. O Google controla a entrada. Ele não é dono da maior parte do que está atrás dela.

O Reddit está em uma posição diferente. As publicações dos seus usuários são protegidas por direitos autorais, e seu termo de uso concede ao Reddit uma licença para todas elas. Engelmayer manteve as alegações sob a seção 1201(a)(1)(A) contra ambos os réus e sob a seção 1201(a)(2) contra a SerpApi, ao mesmo tempo em que rejeitou uma alegação sob 1201(b) e as acusações de enriquecimento sem causa e concorrência desleal baseadas na lei estadual. A mesma análise, mas este autor tinha direitos sobre o conteúdo que protegia. O tribunal deixou em aberto se os pequenos trechos que aparecem nas páginas do Google são de fato protegidos, e a Oxylabs, também citada no processo, ainda tem sua própria moção de arquivamento pendente.

A licença está se tornando a fechadura

O Google entendeu o recado. Sua denúncia emendada, apresentada em 10 de agosto, reconstrói o caso em torno de contratos. Ela afirma que os licenciantes autorizaram controles de acesso "e, em alguns casos, insistiram para que o Google o fizesse". Ela afirma que um parceiro não identificado obriga o Google desde 2017 a "usar esforços comercialmente razoáveis para proteger o conteúdo licenciado contra acesso não autorizado de terceiros", e que o acordo com o Reddit "determina que o Google não permita que terceiros extraiam e comercializem de forma independente o conteúdo licenciado". Ela até apresenta a própria Política de Privacidade do Google como autorização dos usuários.

A segunda moção de arquivamento da SerpApi responde que nenhum desses acordos está de fato diante do tribunal, e que "uma cláusula contra download não é uma cláusula contra acesso". Em 15 de setembro, o juiz negou o pedido da SerpApi para forçar o Google a apresentar as licenças. A audiência sobre a moção em si está marcada para 13 de outubro de 2026, de acordo com o processo.

Acreditamos que a decisão de outubro importa menos do que o manual que ela já estabeleceu. Uma cláusula exigindo que o licenciado proteja o conteúdo contra acesso não autorizado costumava ser texto padrão. Após este verão, ela se tornou o elemento que faltava para uma reivindicação de indenização legal de US$ 200 a US$ 2.500 por violação. Portanto, espere que todo contrato de conteúdo assinado a partir de agora inclua uma, abrangendo os acordos de acesso pago que começaram a se formar em torno do modelo pay-per-crawl.

As contas nunca foram a questão em aberto

Uma parte disso não mudou nada. Em meados de setembro, um juiz federal da Califórnia homologou um termo de acordo entre o LinkedIn e a ProAPIs, juntamente com sua parceira Netswift: parar o scraping, parar de vender ou transferir os dados, parar de usar contas falsas, excluir o que foi coletado. A denúncia do LinkedIn descreveu milhões de contas falsas, com centenas ou milhares criadas diariamente.

Essas alegações se concentraram em contas, não em burlar verificações de segurança. E o resultado foi definitivo: sem acesso, sem revenda, sem dados.

O que isso significa para equipes de dados

Somos engenheiros, não advogados, e ambas as decisões de julho ocorreram na fase de moção de arquivamento (motion to dismiss), e não em julgamento. Encare o que se segue como um mapa de para onde os argumentos estão caminhando e leve as questões críticas ao seu departamento jurídico.

  1. Classifique seus alvos pelo tipo de dado retido. Preços, níveis de estoque, classificações, links e listagens são fatos. Publicações, avaliações, artigos, fotos e letras de música são expressão. A parte permanente da ordem de 20 de julho cobre o primeiro tipo; o caso do Reddit se enquadra no segundo.
  2. A rota não limpa o conteúdo. As reivindicações restantes do Reddit dizem respeito a posts supostamente extraídos das páginas de resultados do Google, e não diretamente de reddit.com. Coletar conteúdo de usuários por meio de um intermediário de busca traz junto a reivindicação do proprietário.
  3. A proteção implementada pelo próprio proprietário é o caso mais forte. O ponto fraco do Google foi aplicar um bloqueio sobre o trabalho de terceiros. Um publisher que possui seus artigos e contratou uma solução antibot para protegê-los não compartilha dessa fraqueza. De acordo com o relatório State of Web Access 2026 da Zyte, 18,5% dos principais sites executam um serviço dedicado de detecção de bots, todos eles por escolha própria.
  4. Mapeie os logins. Se qualquer etapa do seu pipeline realiza autenticação, é aí que a sua exposição ao risco se concentra, independentemente do que os tribunais decidirem sobre verificações de bots.
  5. Considere no orçamento os custos técnicos que nenhum tribunal removerá. O Google confirmou em 26 de agosto que os links de resultados agora passam por um redirecionamento google.com/goto. Derek Perkins, da Nozzle, relatou que os links não podem ser decodificados localmente e que resolver um ranking de cinco páginas exige de 500 a 1.000 requests. Some a isso a remoção do parâmetro num=100 em setembro de 2025 (o impacto disso no monitoramento de rankings) e a extração de dados de busca ficou mais cara duas vezes, sem o envolvimento de nenhum juiz.

Do código aos contratos

Por anos, a discussão sobre scraping girava em torno de saber se uma verificação de bot contava como uma tranca. A resposta deste verão é mais direta do que um simples sim ou não: pode contar, quando a tranca pertence a quem detém os direitos sobre o que está dentro, ou a alguém autorizado por escrito.

Isso transfere a disputa da engenharia para os departamentos de licenciamento. Some a isso a iniciativa da Cloudflare de classificar o tráfego de bots pela finalidade declarada, e o caminho parece definido: o acesso passa a ser decidido por quem você é e pelo que assinou, e cada vez menos pela aparência das suas requests.

Se você coleta fatos públicos, julho tornou sua posição mais clara. Se você coleta o texto de terceiros passando pela portaria de outra pessoa, ficou muito mais difícil se defender.