← Todos os posts

Tarpits de Web Scraping: Quem Realmente é Pego

Sites estão implantando tarpits que prendem crawlers de IA e os alimentam com dados inúteis. Mas essas armadilhas não distinguem entre o GPTBot e o seu rastreador de preços.

Sites estão criando armadilhas para crawlers de AI

Uma ferramenta chamada Nepenthes viralizou no início de 2025. Ela gera labirintos infinitos de páginas web falsas, cada uma apontando para mais páginas falsas, projetadas para prender crawlers em um loop sem saída. O texto nessas páginas? Conteúdo sem sentido gerado algoritmicamente, criado para poluir conjuntos de dados de treinamento de AI com lixo.

O Nepenthes não é o único. Projetos como o Locaine e uma lista crescente de "tarpits" de código aberto surgiram no GitHub, todos com a mesma proposta: se as empresas de AI não respeitarem o robots.txt, os proprietários de sites vão reagir com veneno.

A motivação faz sentido. Um estudo acadêmico no arXiv mostrou que o bloqueio de AI entre sites confiáveis saltou de 23% em setembro de 2023 para quase 60% até maio de 2025. A análise da BuzzStream apontou que 79% dos principais sites de notícias agora bloqueiam bots de treinamento de AI via robots.txt. E o Cloudflare Radar relatou que 75% do tráfego web relacionado a AI em meados de 2025 foi gerado para fins de treinamento, não para busca ou inferência.

Mas tarpits não verificam credenciais. Eles não perguntam por que você está fazendo o crawling. Eles prendem qualquer coisa que pareça automatizada.

Quem realmente está caindo nas armadilhas

Os alvos pretendidos são óbvios: GPTBot, ClaudeBot e os crawlers de empresas de AI coletando a web aberta para dados de treinamento. O problema é que os tarpits não conseguem diferenciar o crawler da OpenAI do seu script de monitoramento de preços.

Tarpits detectam padrões de request automatizados. Se o seu scraper segue links sistematicamente, acessa páginas em intervalos consistentes ou pula a execução de JavaScript (como a maioria dos crawlers de treinamento de AI opera), ele se torna um alvo. A armadilha não se importa se você é uma equipe de e-commerce de 10 pessoas monitorando preços da concorrência. Ela identifica tráfego com perfil de bot e começa a entregar páginas falsas.

Isso não é apenas teórico. Uma pesquisa da Rutgers e de Wharton constatou que sites que bloquearam crawlers de AI tiveram uma queda de 23,1% no tráfego total e uma redução de 13,9% no tráfego humano. A postura de bloqueio agressivo não apenas impede scrapers de AI. Ela também prejudica a visibilidade do próprio site.

E os tarpits vão além: eles desperdiçam ativamente a capacidade de computação, armazenamento e largura de banda de um crawler, enquanto fornecem dados que degradam qualquer modelo ou banco de dados que você esteja construindo.

A escala da escalada

O robots.txt sempre foi um acordo de cavalheiros. Ele funcionava quando todos seguiam as regras. Quando grandes empresas de AI começaram a ignorá-lo (ou a encontrar interpretações criativas para "crawling para busca" versus "crawling para treinamento"), os proprietários de sites aumentaram a resposta.

O padrão é o seguinte:

  1. Bloqueios via robots.txt: o pedido educado
  2. Filtragem por User-Agent: bloqueio de assinaturas conhecidas de crawlers de AI
  3. Detecção comportamental: identificação de crawlers desconhecidos por seus padrões de request
  4. Tarpits: contramedidas ativas que desperdiçam recursos e envenenam dados

Cada etapa intercepta mais ameaças. Cada etapa também atinge mais tráfego legítimo. Na quarta etapa, você passa a tratar todo acesso automatizado como hostil. Assim, um scraper que coleta preços de produtos publicamente disponíveis para um comparador de preços cai nas mesmas armadilhas que o GPTBot coletando dados sem permissão.

O que as equipes de dados devem fazer agora

Se você executa coleta de dados em qualquer escala, os tarpits mudam as regras. Vários pontos importam mais do que antes.

Respeite o robots.txt, sempre. Isso parece básico, mas agora é o requisito mínimo. Os sites usam o robots.txt como um filtro de primeira passagem. Ignore isso e você será colocado na mesma categoria dos bots de treinamento de AI que provocaram toda essa reação com tarpits.

Não se pareça com um crawler de treinamento. Crawlers de treinamento de AI têm assinaturas previsíveis: eles seguem todos os links, solicitam páginas em lote, ignoram JavaScript e mantêm intervalos regulares. Se o seu scraper fizer o mesmo, a detecção comportamental vai sinalizá-lo. Varie seu intervalo de tempo. Carregue apenas o que você precisa. Execute JavaScript quando o site exigir. Escrevemos sobre o que faz scrapers serem bloqueados em Why Your Web Scraper Keeps Breaking.

Valide os dados recebidos. Tarpits entregam lixo com aparência plausível. Se você não estiver verificando as responses no seu pipeline, poderá armazenar texto gerado por cadeias de Markov como descrições reais de produtos. Crie a validação como uma etapa central, não como algo secundário.

Invista na sua infraestrutura de requests. O método antigo (rotacionar IPs, tentar novamente em caso de falha) não é mais suficiente. Sistemas modernos de detecção de bots analisam fingerprints de TLS, comportamento do navegador e padrões de sessão. O roteamento inteligente de proxies ajuda, mas a verdadeira mudança é da detecção em nível de IP para o nível comportamental. Se você faz scraping em sites carregados de JavaScript, a coleta baseada em navegador é cada vez mais a única abordagem confiável.

A lacuna de acesso está aumentando

Acreditamos que a web caminha para uma divisão clara. De um lado: sites que monetizam dados por meio de acordos de acesso pago, parcerias de API e crawling licenciado. Do outro: sites que tratam todo acesso automatizado como uma ameaça e implementam contramedidas cada vez mais agressivas.

Para as equipes de dados, isso significa que os custos de coleta continuarão subindo. Não porque a tecnologia seja mais difícil de construir, mas porque o ambiente está mais hostil. As equipes que investirem em práticas de scraping responsáveis e transparentes manterão seu acesso. Aquelas que se parecerem com bots de treinamento serão capturadas, envenenadas e bloqueadas.

Os tarpits não vão desaparecer. A questão para a sua equipe não é se deve se preocupar com eles. É se a sua infraestrutura consegue identificar a diferença entre uma página real e uma armadilha antes que esses dados cheguem ao seu banco de dados.