Uma verificação de bot, dois tribunais, respostas opostas
Com um intervalo de onze dias neste verão, dois juízes federais analisaram a mesma verificação de bot do Google, o mesmo réu e o mesmo tipo de alegação. Eles chegaram a conclusões opostas.
Em 20 de julho de 2026, a Juíza-Chefe Yvonne Gonzalez Rogers, do Distrito Norte da Califórnia, rejeitou as alegações de DMCA do Google contra a SerpApi, a empresa que vende resultados do Google por meio de uma API. Em 31 de julho, o Juiz Paul Engelmayer, do Distrito Sul de Nova York, negou em grande parte os pedidos da SerpApi e da Perplexity para rejeitar a ação do Reddit, que se baseia no mesmo sistema do Google.
| Caso | Tribunal | Decisão | Alegações de DMCA |
|---|---|---|---|
| Google v. SerpApi | N.D. California | 20 de julho de 2026 | Rejeitadas |
| Reddit v. SerpApi | S.D. New York | 31 de julho de 2026 | Mantidas em grande parte |
O processo do Google contra a SerpApi ganhou as manchetes, e grande parte da cobertura considerou julho como uma vitória e uma derrota para scrapers. Interpretamos isso de forma diferente. Passar pela verificação não foi o fator que separou os dois resultados. O que estava por trás da verificação, e quem detém os direitos sobre isso, sim. Para quem faz coleta de dados na web, essa é uma regra muito mais útil do que qualquer manchete.
Como o SearchGuard se parece para quem recebe
O SearchGuard é o desafio em JavaScript que o Google colocou na Busca em janeiro de 2025. Segundo o próprio Google, uma consulta vinda de uma fonte não reconhecida recebe código para executar. O navegador de um usuário real responde sem que ninguém perceba; a maioria dos clientes automatizados não consegue e recebe uma recusa.
Nós mesmos encontramos isso. Em testes que realizamos em 17 de setembro de 2026, a Busca do Google respondeu a algumas requests automatizadas com uma página de 92 KB intitulada apenas "Google Search": HTTP 200, sem resultados e com um aviso para ativar o JavaScript. A barreira do próprio Reddit é muito parecida na rede (um 200 intitulado "Reddit - Prove your humanity"). Qualquer sistema que avalie o sucesso apenas pelo código de status registra ambos como páginas entregues.
Aqui está a parte que passou despercebida nas manchetes. A Juíza Gonzalez Rogers não concluiu que a SerpApi nunca contornou o SearchGuard. Ela considerou que o Google alegou adequadamente uma violação da Seção 1201 do DMCA e rejeitou o argumento da SerpApi de que o Google, por não ser o proprietário, não poderia processar. O Google perdeu de qualquer forma.
O que isso significa: os tribunais não estão tratando "você passou pela verificação?" como a pergunta decisiva. Eles estão tratando isso como o ponto de partida de uma.
Por que o Google perdeu e o Reddit não
A Seção 1201 da DMCA proíbe contornar uma medida que controla o acesso a "uma obra protegida sob este título", o que significa uma obra protegida por direitos autorais. A própria denúncia do Google descreveu seus resultados como compilações de informações públicas, com Painéis de Conhecimento que "podem conter algum conteúdo protegido por direitos autorais". A decisão levou o Google ao pé da letra: "Na medida em que os resultados do Google Search não contêm nenhum conteúdo protegido por direitos autorais, não se pode dizer que o SearchGuard controla eficazmente o acesso a uma obra protegida pela Lei de Direitos Autorais". Essa metade do caso foi arquivada sem permissão para emenda.
A parte referente aos Painéis de Conhecimento falhou em um segundo teste. A medida precisa operar "com a autorização do detentor dos direitos autorais", e o Google não apresentou nenhum termo das licenças por trás daquelas imagens. O Google controla a entrada. Ele não é dono da maior parte do que está atrás dela.
O Reddit está em uma posição diferente. As publicações dos seus usuários são protegidas por direitos autorais, e seu termo de uso concede ao Reddit uma licença para todas elas. Engelmayer manteve as alegações sob a seção 1201(a)(1)(A) contra ambos os réus e sob a seção 1201(a)(2) contra a SerpApi, ao mesmo tempo em que rejeitou uma alegação sob 1201(b) e as acusações de enriquecimento sem causa e concorrência desleal baseadas na lei estadual. A mesma análise, mas este autor tinha direitos sobre o conteúdo que protegia. O tribunal deixou em aberto se os pequenos trechos que aparecem nas páginas do Google são de fato protegidos, e a Oxylabs, também citada no processo, ainda tem sua própria moção de arquivamento pendente.
A licença está se tornando a fechadura
O Google entendeu o recado. Sua denúncia emendada, apresentada em 10 de agosto, reconstrói o caso em torno de contratos. Ela afirma que os licenciantes autorizaram controles de acesso "e, em alguns casos, insistiram para que o Google o fizesse". Ela afirma que um parceiro não identificado obriga o Google desde 2017 a "usar esforços comercialmente razoáveis para proteger o conteúdo licenciado contra acesso não autorizado de terceiros", e que o acordo com o Reddit "determina que o Google não permita que terceiros extraiam e comercializem de forma independente o conteúdo licenciado". Ela até apresenta a própria Política de Privacidade do Google como autorização dos usuários.
A segunda moção de arquivamento da SerpApi responde que nenhum desses acordos está de fato diante do tribunal, e que "uma cláusula contra download não é uma cláusula contra acesso". Em 15 de setembro, o juiz negou o pedido da SerpApi para forçar o Google a apresentar as licenças. A audiência sobre a moção em si está marcada para 13 de outubro de 2026, de acordo com o processo.
Acreditamos que a decisão de outubro importa menos do que o manual que ela já estabeleceu. Uma cláusula exigindo que o licenciado proteja o conteúdo contra acesso não autorizado costumava ser texto padrão. Após este verão, ela se tornou o elemento que faltava para uma reivindicação de indenização legal de US$ 200 a US$ 2.500 por violação. Portanto, espere que todo contrato de conteúdo assinado a partir de agora inclua uma, abrangendo os acordos de acesso pago que começaram a se formar em torno do modelo pay-per-crawl.
As contas nunca foram a questão em aberto
Uma parte disso não mudou nada. Em meados de setembro, um juiz federal da Califórnia homologou um termo de acordo entre o LinkedIn e a ProAPIs, juntamente com sua parceira Netswift: parar o scraping, parar de vender ou transferir os dados, parar de usar contas falsas, excluir o que foi coletado. A denúncia do LinkedIn descreveu milhões de contas falsas, com centenas ou milhares criadas diariamente.
Essas alegações se concentraram em contas, não em burlar verificações de segurança. E o resultado foi definitivo: sem acesso, sem revenda, sem dados.
O que isso significa para equipes de dados
Somos engenheiros, não advogados, e ambas as decisões de julho ocorreram na fase de moção de arquivamento (motion to dismiss), e não em julgamento. Encare o que se segue como um mapa de para onde os argumentos estão caminhando e leve as questões críticas ao seu departamento jurídico.
- Classifique seus alvos pelo tipo de dado retido. Preços, níveis de estoque, classificações, links e listagens são fatos. Publicações, avaliações, artigos, fotos e letras de música são expressão. A parte permanente da ordem de 20 de julho cobre o primeiro tipo; o caso do Reddit se enquadra no segundo.
- A rota não limpa o conteúdo. As reivindicações restantes do Reddit dizem respeito a posts supostamente extraídos das páginas de resultados do Google, e não diretamente de reddit.com. Coletar conteúdo de usuários por meio de um intermediário de busca traz junto a reivindicação do proprietário.
- A proteção implementada pelo próprio proprietário é o caso mais forte. O ponto fraco do Google foi aplicar um bloqueio sobre o trabalho de terceiros. Um publisher que possui seus artigos e contratou uma solução antibot para protegê-los não compartilha dessa fraqueza. De acordo com o relatório State of Web Access 2026 da Zyte, 18,5% dos principais sites executam um serviço dedicado de detecção de bots, todos eles por escolha própria.
- Mapeie os logins. Se qualquer etapa do seu pipeline realiza autenticação, é aí que a sua exposição ao risco se concentra, independentemente do que os tribunais decidirem sobre verificações de bots.
- Considere no orçamento os custos técnicos que nenhum tribunal removerá. O Google confirmou em 26 de agosto que os links de resultados agora passam por um redirecionamento google.com/goto. Derek Perkins, da Nozzle, relatou que os links não podem ser decodificados localmente e que resolver um ranking de cinco páginas exige de 500 a 1.000 requests. Some a isso a remoção do parâmetro num=100 em setembro de 2025 (o impacto disso no monitoramento de rankings) e a extração de dados de busca ficou mais cara duas vezes, sem o envolvimento de nenhum juiz.
Do código aos contratos
Por anos, a discussão sobre scraping girava em torno de saber se uma verificação de bot contava como uma tranca. A resposta deste verão é mais direta do que um simples sim ou não: pode contar, quando a tranca pertence a quem detém os direitos sobre o que está dentro, ou a alguém autorizado por escrito.
Isso transfere a disputa da engenharia para os departamentos de licenciamento. Some a isso a iniciativa da Cloudflare de classificar o tráfego de bots pela finalidade declarada, e o caminho parece definido: o acesso passa a ser decidido por quem você é e pelo que assinou, e cada vez menos pela aparência das suas requests.
Se você coleta fatos públicos, julho tornou sua posição mais clara. Se você coleta o texto de terceiros passando pela portaria de outra pessoa, ficou muito mais difícil se defender.