← Todos los artículos

Tarpits en Web Scraping: Quién cae realmente en la trampa

Los sitios web están desplegando tarpits que atrapan a los crawlers de IA y los alimentan con datos basura. Pero estas trampas no distinguen entre GPTBot y tu tracker de precios.

Los sitios web están tendiendo trampas a los crawlers de IA

Una herramienta llamada Nepenthes se volvió viral a principios de 2025. Genera laberintos infinitos de páginas web falsas, cada una enlazando a más páginas falsas, diseñadas para atrapar a los crawlers en un bucle del que no pueden escapar. ¿El texto en esas páginas? Texto sin sentido generado algorítmicamente, diseñado para contaminar los datasets de entrenamiento de IA con basura.

Nepenthes no es la única. Proyectos como Locaine y una lista creciente de "tarpits" open-source han aparecido en GitHub, todos con la misma propuesta: si las empresas de IA no respetan robots.txt, los propietarios de los sitios responderán con veneno.

La motivación tiene sentido. Un estudio académico en arXiv descubrió que el bloqueo de IA entre sitios de buena reputación pasó del 23% en septiembre de 2023 a casi el 60% en mayo de 2025. El análisis de BuzzStream mostró que el 79% de los principales sitios de noticias ahora bloquean bots de entrenamiento de IA mediante robots.txt. Y Cloudflare Radar reportó que el 75% del tráfico web relacionado con IA a mediados de 2025 fue generado para fines de entrenamiento, no para búsqueda ni inferencia.

Pero los tarpits no verifican credenciales. No preguntan por qué estás haciendo scraping. Atrapan cualquier cosa que parezca automatizada.

Quién cae realmente en la trampa

Los objetivos previstos son obvios: GPTBot, ClaudeBot, los crawlers de empresas de IA que recopilan la web abierta para datos de entrenamiento. El problema es que los tarpits no pueden distinguir entre el crawler de OpenAI y tu script de monitorización de precios.

Los tarpits detectan patrones de request automatizados. Si tu scraper sigue enlaces sistemáticamente, accede a páginas en intervalos constantes o no ejecuta JavaScript (la forma en que operan la mayoría de los crawlers de entrenamiento de IA), parece un objetivo. A la trampa no le importa que seas un equipo de e-commerce de 10 personas rastreando los precios de la competencia. Detecta tráfico con patrón de bot y comienza a servir páginas falsas.

Esto no es solo teórico. Una investigación de Rutgers y Wharton descubrió que los sitios que bloquean crawlers de IA sufrieron una caída del 23.1% en el tráfico total y una reducción del 13.9% en el tráfico humano. La postura de bloqueo agresiva no solo detiene a los scrapers de IA. También perjudica la propia visibilidad del sitio.

Y los tarpits van más allá: desperdician activamente el cómputo, almacenamiento y ancho de banda de un crawler mientras le envían datos que degradan cualquier modelo o base de datos que esté construyendo.

La escala de conflicto

Robots.txt siempre fue un pacto de caballeros. Funcionaba cuando todos seguían las reglas. Cuando las principales empresas de IA comenzaron a ignorarlo (o a encontrar interpretaciones creativas de "crawling para búsqueda" frente a "crawling para entrenamiento"), los propietarios de sitios web escalaron sus defensas.

El patrón se ve así:

  1. Bloqueos por robots.txt: la petición educada
  2. Filtrado por User-Agent: bloqueo de firmas conocidas de crawlers de IA
  3. Detección de comportamiento: detección de crawlers desconocidos mediante sus patrones de request
  4. Tarpits: contramedidas activas que consumen recursos e intoxican datos

Cada paso detecta más amenazas. Cada paso también afecta a más tráfico legítimo. En el cuarto paso, estás tratando todo acceso automatizado como hostil. Así, un scraper que recopila precios de productos disponibles públicamente para un comparador cae en las mismas trampas que GPTBot recopilando datos sin autorización.

Qué deben hacer los equipos de datos ahora

Si ejecutas extracción de datos a cualquier escala, los tarpits cambian las reglas. Varios factores importan ahora más que antes.

Respeta robots.txt, siempre. Parece algo básico, pero hoy es un requisito mínimo. Los sitios usan robots.txt como un primer filtro. Si lo ignoras, te sitúas en la misma categoría que los bots de entrenamiento de IA que originaron toda esta respuesta con tarpits.

No te comportes como un crawler de entrenamiento. Los crawlers de entrenamiento de IA tienen firmas predecibles: siguen cada enlace, solicitan páginas en masa, omiten JavaScript y mantienen intervalos regulares. Si tu scraper hace lo mismo, la detección de comportamiento lo marcará. Varía tus tiempos. Carga solo lo que necesitas. Ejecuta JavaScript cuando el sitio lo requiera. Escribimos sobre las causas que provocan el bloqueo de scrapers en Why Your Web Scraper Keeps Breaking.

Valida los datos entrantes. Los tarpits devuelven basura con apariencia verosímil. Si no compruebas las responses en tu pipeline, podrías estar almacenando texto generado por cadenas de Markov como descripciones reales de productos. Implementa la validación como un paso central, no secundario.

Invierte en tu infraestructura de requests. La estrategia tradicional (rotar IPs, reintentar tras fallos) ya no es suficiente. Los sistemas modernos de detección de bots analizan huellas TLS, comportamiento del navegador y patrones de sesión. El enrutamiento inteligente de proxies ayuda, pero el cambio real va de la detección por IP a la detección por comportamiento. Si extraes datos de sitios con uso intensivo de JavaScript, la extracción basada en navegador es cada vez más el único enfoque fiable.

La brecha de acceso sigue creciendo

Consideramos que la web avanza hacia una división clara. Por un lado: sitios que monetizan datos mediante acuerdos de acceso de pago, alianzas de API y crawling bajo licencia. Por el otro: sitios que tratan todo acceso automatizado como una amenaza y despliegan contramedidas progresivamente agresivas.

Para los equipos de datos, esto significa que los costes de extracción seguirán subiendo. No porque la tecnología sea más difícil de construir, sino porque el entorno es más hostil. Los equipos que inviertan en prácticas de scraping responsables y transparentes mantendrán su acceso. Los que se comporten como bots de entrenamiento quedarán atrapados, intoxicados y bloqueados.

Los tarpits no van a desaparecer. La pregunta para tu equipo no es si debes preocuparte por ellos. Es si tu infraestructura puede detectar la diferencia entre una página real y una trampa antes de que esos datos lleguen a tu base de datos.