← Tous les articles

Tarpits de Web Scraping : qui se fait vraiment piéger

Des sites web déploient des tarpits pour piéger les crawlers d'IA et leur injecter des données erronées. Mais ces pièges ne font pas la différence entre GPTBot et votre tracker de prix.

Les sites tendent des pièges aux crawlers d'IA

Un outil nommé Nepenthes est devenu viral début 2025. Il génère des labyrinthes infinis de fausses pages web, chacune renvoyant vers d'autres fausses pages, conçues pour piéger les crawlers dans une boucle sans fin. Le texte sur ces pages ? Du charabia généré par algorithme, conçu pour polluer les jeux de données d'entraînement d'IA avec du contenu inutile.

Nepenthes n'est pas le seul. Des projets comme Locaine et une liste croissante de « tarpits » open source sont apparus sur GitHub, avec le même argument : si les entreprises d'IA ne respectent pas le fichier robots.txt, les propriétaires de sites riposteront avec du poison.

La motivation est compréhensible. Une étude universitaire sur arXiv a révélé que le blocage de l'IA sur les sites de référence est passé de 23 % en septembre 2023 à près de 60 % en mai 2025. L'analyse de BuzzStream a montré que 79 % des principaux sites d'actualités bloquent désormais les bots d'entraînement d'IA via robots.txt. Et Cloudflare Radar a rapporté que 75 % du trafic web lié à l'IA mi-2025 était généré pour l'entraînement, et non pour la recherche ou l'inférence.

Mais les tarpits ne vérifient pas les identifiants. Ils ne vous demandent pas pourquoi vous crawlez. Ils piègent tout ce qui ressemble à un processus automatisé.

Qui se fait réellement piéger

Les cibles visées sont évidentes : GPTBot, ClaudeBot, les crawlers des entreprises d'IA qui collectent le web ouvert pour leurs données d'entraînement. Le problème est que les tarpits ne font pas la différence entre le crawler d'OpenAI et votre script de surveillance des prix.

Les tarpits détectent les schémas de requêtes automatisées. Si votre scraper suit des liens de manière systématique, consulte des pages à intervalles réguliers ou ignore l'exécution de JavaScript (comme le font la plupart des crawlers d'entraînement d'IA), il devient une cible. Le piège ne se soucie pas du fait que vous soyez une équipe e-commerce de 10 personnes surveillant les prix des concurrents. Il détecte un trafic de type bot et commence à renvoyer de fausses pages.

Ce n'est pas seulement théorique. Des recherches de Rutgers et Wharton ont montré que les sites bloquant les crawlers d'IA ont enregistré une baisse de 23,1 % de leur trafic total et une baisse de 13,9 % de leur trafic humain. Cette posture de blocage agressive ne stoppe pas seulement les scrapers d'IA. Elle nuit également à la propre visibilité du site.

Et les tarpits vont plus loin : ils consomment activement le calcul, le stockage et la bande passante d'un crawler tout en lui injectant des données qui dégradent le modèle ou la base de données qu'il alimente.

L'escalade des mesures

Le fichier robots.txt a toujours été un accord de principe. Il fonctionnait quand tout le monde respectait les règles. Lorsque les grandes entreprises d'IA ont commencé à l'ignorer (ou à trouver des interprétations créatives de la différence entre « crawler pour la recherche » et « crawler pour l'entraînement »), les propriétaires de sites ont durci le ton.

Le schéma se présente ainsi :

  1. Blocages robots.txt : la requête polie
  2. Filtrage par User-Agent : blocage des signatures connues de crawlers d'IA
  3. Détection comportementale : identification des crawlers inconnus d'après leurs schémas de requêtes
  4. Tarpits : contre-mesures actives qui gaspillent les ressources et empoisonnent les données

Chaque étape intercepte davantage de menaces. Chaque étape intercepte également davantage de trafic légitime. À la quatrième étape, vous traitez tout accès automatisé comme hostile. Ainsi, un scraper collectant des prix de produits publiquement disponibles pour un comparateur tombe dans les mêmes pièges que GPTBot collectant des données sans autorisation.

Ce que les équipes data doivent faire maintenant

Si vous gérez de la collecte de données à grande échelle, les tarpits changent la donne. Plusieurs éléments deviennent plus déterminants qu'auparavant.

Respectez toujours robots.txt. Cela semble élémentaire, mais c'est aujourd'hui indispensable. Les sites utilisent robots.txt comme premier filtre. Si vous l'ignorez, vous vous classez directement dans la même catégorie que les bots d'entraînement d'IA qui ont provoqué cette réaction défensive.

Ne ressemblez pas à un crawler d'entraînement. Les crawlers d'entraînement d'IA ont des signatures prévisibles : ils suivent chaque lien, demandent des pages en masse, ignorent le JavaScript et maintiennent des intervalles réguliers. Si votre scraper fait de même, la détection comportementale le signalera. Variez votre timing. Ne chargez que ce dont vous avez besoin. Exécutez le JavaScript lorsque le site l'exige. Nous avons détaillé les causes de blocage des scrapers dans Why Your Web Scraper Keeps Breaking.

Validez les données entrantes. Les tarpits renvoient des données corrompues d'apparence plausible. Si vous ne vérifiez pas les réponses dans votre pipeline, vous risquez de stocker du texte généré par chaînes de Markov comme de véritables descriptions de produits. Intégrez la validation comme une étape centrale, et non comme un élément secondaire.

Investissez dans votre infrastructure de requêtes. L'ancienne approche (rotation d'IP, nouvelles tentatives en cas d'échec) ne suffit plus. Les systèmes modernes de détection de bots analysent les empreintes TLS, le comportement du navigateur et les schémas de session. Le Smart proxy routing aide, mais le véritable changement s'opère de la détection au niveau IP vers la détection comportementale. Si vous scrapez des sites riches en JavaScript, la browser-based collection devient progressivement la seule approche fiable.

Le fossé d'accès se creuse

Nous pensons que le web s'oriente vers une scission nette. D'un côté : les sites qui monétisent leurs données via des accords d'accès payants, des partenariats API et du crawling sous licence. De l'autre : les sites qui traitent tout accès automatisé comme une menace et déploient des contre-mesures de plus en plus agressives.

Pour les équipes data, cela signifie que les coûts de collecte vont continuer d'augmenter. Non pas parce que la technologie est plus difficile à concevoir, mais parce que l'environnement est plus hostile. Les équipes qui investissent dans des pratiques de scraping responsables et transparentes conserveront leur accès. Celles qui ressemblent à des bots d'entraînement seront piégées, empoisonnées et bloquées.

Les tarpits ne vont pas disparaître. La question pour votre équipe n'est pas de savoir s'il faut s'en préoccuper. Il s'agit de savoir si votre infrastructure peut faire la différence entre une vraie page et un piège avant que ces données n'atteignent votre base de données.