Los sitios web están tendiendo trampas para los crawlers de IA
Una herramienta llamada Nepenthes se volvió viral a principios de 2025. Genera laberintos infinitos de páginas web falsas, cada una enlazando a más páginas falsas, diseñadas para atrapar a los crawlers en un bucle del que no pueden escapar. ¿El texto de esas páginas? Un galimatías generado algorítmicamente, diseñado para contaminar los datasets de entrenamiento de IA con basura.
Nepenthes no está solo. Proyectos como Locaine y una creciente lista de "tarpits" de código abierto han aparecido en GitHub, cada uno con el mismo argumento: si las empresas de IA no respetan el archivo robots.txt, los propietarios de los sitios se defenderán con veneno.
La motivación tiene sentido. Un estudio académico en arXiv encontró que el bloqueo de IA entre sitios web de buena reputación saltó del 23% en septiembre de 2023 a casi el 60% en mayo de 2025. El análisis de BuzzStream mostró que el 79% de los principales sitios de noticias ahora bloquean a los bots de entrenamiento de IA a través de robots.txt. Y Cloudflare Radar reportó que el 75% del tráfico web relacionado con IA a mediados de 2025 fue generado con fines de entrenamiento, no para búsqueda o inferencia.
Pero los tarpits no comprueban credenciales. No preguntan por qué estás haciendo el crawling. Atrapan cualquier cosa que parezca automatizada.
Quién está cayendo realmente en la trampa
Los objetivos previstos son obvios: GPTBot, ClaudeBot, los crawlers de las empresas de IA que recopilan datos de la web abierta para entrenamiento. El problema es que los tarpits no pueden distinguir entre el crawler de OpenAI y tu script de monitorización de precios.
Los tarpits detectan patrones de requests automatizados. Si tu scraper sigue los enlaces sistemáticamente, visita las páginas a intervalos constantes o se salta la ejecución de JavaScript (la forma en que operan la mayoría de los crawlers de entrenamiento de IA), parece un objetivo. A la trampa no le importa que seas un equipo de comercio electrónico de 10 personas haciendo el tracking de los precios de la competencia. Ve un tráfico con forma de bot y empieza a servir páginas falsas.
Esto no es solo teórico. Una investigación de Rutgers y Wharton encontró que los sitios que bloquean a los crawlers de IA vieron una caída del 23.1% en el tráfico total y una caída del 13.9% en el tráfico humano. La postura agresiva de bloqueo no solo detiene a los scrapers de IA. También perjudica la propia visibilidad del sitio.
Y los tarpits van más allá: malgastan activamente el cómputo, el almacenamiento y el ancho de banda del crawler, al tiempo que le suministran datos que degradan cualquier modelo o base de datos que esté construyendo.
La escalada
Robots.txt siempre fue un acuerdo de caballeros. Funcionaba cuando todo el mundo seguía las reglas. Cuando las grandes empresas de IA empezaron a ignorarlo (o a encontrar interpretaciones creativas de "crawling para búsqueda" frente a "crawling para entrenamiento"), los propietarios de los sitios escalaron el nivel.
El patrón se ve así:
- Bloqueos de Robots.txt: la petición educada
- Filtrado de User-Agent: bloqueo de firmas conocidas de crawlers de IA
- Detección de comportamiento: captura de crawlers desconocidos por sus patrones de requests
- Tarpits: contramedidas activas que malgastan recursos y envenenan los datos
Cada paso atrapa más amenazas. Cada paso también atrapa más tráfico legítimo. Para el paso cuatro, estás tratando todo acceso automatizado como hostil. Así que un scraper que recopila precios de productos disponibles públicamente para un servicio de comparación cae en las mismas trampas que GPTBot recopilando datos sin permiso.
Qué deberían hacer los equipos de datos ahora
Si estás ejecutando una recopilación de datos a cualquier escala, los tarpits cambian las reglas. Hay varias cosas que importan más de lo que solían.
Respeta robots.txt, siempre. Esto suena básico, pero ahora es lo mínimo exigible. Los sitios usan robots.txt como filtro de primer paso. Ignóralo y te estarás poniendo en la misma categoría que los bots de entrenamiento de IA que iniciaron toda esta respuesta de los tarpits.
No parezcas un crawler de entrenamiento. Los crawlers de entrenamiento de IA tienen firmas predecibles: siguen cada enlace, piden páginas a granel, se saltan JavaScript y mantienen intervalos regulares. Si tu scraper hace lo mismo, la detección de comportamiento lo marcará. Varía tu timing. Carga solo lo que necesites. Ejecuta JavaScript cuando el sitio lo requiera. Escribimos sobre qué causa que los scrapers sean bloqueados en Por qué tu Web Scraper se rompe continuamente.
Valida los datos entrantes. Los tarpits sirven basura de aspecto plausible. Si no estás comprobando las responses en tu pipeline, podrías estar almacenando texto generado por cadenas de Markov como si fueran descripciones de productos reales. Construye la validación como un paso central, no como una ocurrencia tardía.
Invierte en tu infraestructura de requests. El viejo manual (rotar IPs, resolver CAPTCHAs, reintentar en caso de fallo) no es suficiente. Los sistemas anti-bot modernos analizan fingerprints de TLS, el comportamiento del navegador y los patrones de sesión. El enrutamiento inteligente de proxys ayuda, pero el cambio real es de la detección a nivel de IP a la detección a nivel de comportamiento. Si estás haciendo scraping de sitios con mucho JavaScript, la recolección basada en navegador es cada vez más el único enfoque fiable.
La brecha de acceso se amplía
Creemos que la web se dirige hacia una división clara. Por un lado: sitios que monetizan los datos a través de acuerdos de acceso de pago, asociaciones de API y crawling con licencia. Por el otro: sitios que tratan todo acceso automatizado como una amenaza y despliegan contramedidas cada vez más agresivas.
Para los equipos de datos, esto significa que los costes de recolección seguirán aumentando. No porque la tecnología sea más difícil de construir, sino porque el entorno es más hostil. Los equipos que invierten en prácticas de scraping responsables y transparentes mantendrán su acceso. Los que parezcan bots de entrenamiento serán atrapados, envenenados y bloqueados.
Los tarpits no van a desaparecer. La pregunta para tu equipo no es si debe preocuparse por ellos. Es si tu infraestructura puede detectar la diferencia entre una página real y una trampa antes de que esos datos lleguen a tu base de datos.