Websites stellen Fallen für KI-Crawler
Ein Tool namens Nepenthes ging Anfang 2025 viral. Es erzeugt endlose Labyrinthe aus gefälschten Webseiten, die jeweils auf weitere Fake-Seiten verlinken. Entwickelt, um Crawler in einer Endlosschleife zu fangen. Der Text auf diesen Seiten? Algorithmisch erzeugtes Kauderwelsch, gedacht, um Trainingsdatensätze von KIs mit Müll zu vergiften.
Nepenthes ist kein Einzelfall. Projekte wie Locaine und eine wachsende Liste von Open-Source-Tarpits tauchen auf GitHub auf, alle mit demselben Ansatz: Wenn KI-Unternehmen die robots.txt nicht respektieren, wehren sich Website-Betreiber mit Gift.
Die Motivation ist nachvollziehbar. Eine akademische Studie auf arXiv ergab, dass das Blockieren von KIs auf seriösen Websites von 23% im September 2023 auf fast 60% im Mai 2025 sprunghaft anstieg. Die Analyse von BuzzStream zeigte, dass 79% der führenden Nachrichtenseiten KI-Trainingsbots mittlerweile per robots.txt blockieren. Und Cloudflare Radar meldete, dass 75% des KI-bezogenen Web-Traffics Mitte 2025 zu Trainingszwecken generiert wurden, nicht für Suche oder Inferenz.
Aber Tarpits prüfen keine Anmeldedaten. Sie fragen nicht, warum du crawltest. Sie fangen alles ab, was automatisiert aussieht.
Wer tatsächlich in der Falle sitzt
Die eigentlichen Ziele sind klar: GPTBot, ClaudeBot, die Crawler der KI-Unternehmen, die das offene Web nach Trainingsdaten durchsuchen. Das Problem: Tarpits unterscheiden nicht zwischen dem Crawler von OpenAI und deinem Preis-Monitoring-Script.
Tarpits erkennen automatisierte Request-Muster. Wenn dein Scraper Links systematisch folgt, Seiten in gleichmäßigen Abständen abruft oder die JavaScript-Ausführung überspringt (wie es die meisten KI-Trainings-Crawler tun), sieht er wie ein Ziel aus. Der Falle ist es egal, dass du ein 10-köpfiges E-Commerce-Team bist, das Wettbewerberpreise trackt. Sie sieht Bot-Traffic und liefert Fake-Seiten aus.
Das ist nicht nur Theorie. Forschungen von Rutgers und Wharton zeigten, dass Websites, die KI-Crawler blockieren, einen Rückgang von 23,1% beim Gesamttraffic und 13,9% beim menschlichen Traffic verzeichneten. Die aggressive Blockadehaltung stoppt nicht nur KI-Scraper. Sie schadet auch der eigenen Sichtbarkeit der Website.
Und Tarpits gehen noch weiter: Sie verschwenden aktiv Rechenleistung, Speicher und Bandbreite des Crawlers, während sie ihm Daten zuführen, die das jeweilige Modell oder die Datenbank ruinieren.
Die Eskalationsstufe
Die robots.txt war immer ein Gentleman's Agreement. Sie funktionierte, als sich alle an die Regeln hielten. Als große KI-Unternehmen anfingen, sie zu ignorieren (oder kreative Interpretationen von "Crawlen für Suche" gegenüber "Crawlen für Training" zu finden), eskalierten die Website-Betreiber.
Das Muster sieht so aus:
- Robots.txt-Blockaden: die höfliche Bitte
- User-Agent-Filterung: Blockieren bekannter AI-Crawler-Signaturen
- Verhaltenserkennung: Erkennen unbekannter Crawler anhand ihrer Request-Muster
- Tarpits: aktive Gegenmaßnahmen, die Ressourcen verschwenden und Daten vergiften
Jeder Schritt fängt mehr Bedrohungen ab. Jeder Schritt erfasst aber auch mehr legitimen Traffic. Bei Schritt vier behandelst du jeden automatisierten Zugriff als feindselig. Ein Scraper, der öffentlich verfügbare Produktpreise für einen Vergleichsdienst sammelt, tappt also in dieselben Fallen wie GPTBot, der unerlaubt Daten sammelt.
Was Datenteams jetzt tun sollten
Wenn du Datenerfassung in größerem Maßstab betreibst, verändern Tarpits die Regeln. Einige Punkte sind jetzt deutlich wichtiger als früher.
Respektiere immer die robots.txt. Das klingt trivial, ist heute aber Grundvoraussetzung. Websites nutzen die robots.txt als ersten Filter. Wenn du sie ignorierst, landest du in derselben Kategorie wie die AI-Trainings-Bots, die diese ganze Tarpit-Welle erst ausgelöst haben.
Verhalte dich nicht wie ein Trainings-Crawler. AI-Trainings-Crawler haben vorhersehbare Signaturen: Sie folgen jedem Link, rufen Seiten massenhaft ab, ignorieren JavaScript und halten feste Intervalle ein. Wenn dein Scraper das auch tut, schlägt die Verhaltenserkennung an. Variiere dein Timing. Lade nur, was du wirklich brauchst. Führe JavaScript aus, wenn die Website es erfordert. Wir haben in Why Your Web Scraper Keeps Breaking beschrieben, warum Scraper blockiert werden.
Validiere eingehende Daten. Tarpits liefern plausibel aussehenden Müll. Wenn du Responses in deiner Pipeline nicht prüfst, speicherst du am Ende womöglich Markov-generierten Text als echte Produktbeschreibungen. Mach die Validierung zu einem zentralen Schritt, nicht zu einem nachträglichen Gedanken.
Investiere in deine Request-Infrastruktur. Das alte Muster (IPs rotieren, bei Fehlern wiederholen) reicht nicht mehr aus. Moderne Bot-Detection-Systeme analysieren TLS-Fingerprints, Browser-Verhalten und Session-Muster. Smartes Proxy-Routing hilft, aber der eigentliche Wandel geht von der Erkennung auf IP-Ebene hin zur Verhaltenserkennung. Wenn du JavaScript-lastige Websites scrapest, ist browserbasierte Datenerfassung zunehmend der einzige verlässliche Ansatz.
Die Zugriffskluft wird größer
Wir glauben, dass sich das Web klar spalten wird. Auf der einen Seite: Websites, die Daten über bezahlte Zugriffsvereinbarungen, API-Partnerschaften und lizenziertes Crawling monetarisieren. Auf der anderen Seite: Websites, die jeden automatisierten Zugriff als Bedrohung ansehen und zunehmend aggressive Gegenmaßnahmen ergreifen.
Für Datenteams bedeutet das, dass die Kosten für die Erfassung weiter steigen. Nicht, weil die Technologie schwerer zu bauen ist, sondern weil die Umgebung feindseliger wird. Die Teams, die in verantwortungsvolle, transparente Scraping-Praktiken investieren, werden ihren Zugriff behalten. Die Teams, die wie Trainings-Bots wirken, geraten in Fallen, werden mit manipulierten Daten gefüttert und ausgesperrt.
Tarpits werden nicht verschwinden. Die Frage für dein Team ist nicht, ob du dir darüber Gedanken machen solltest. Sie ist, ob deine Infrastruktur den Unterschied zwischen einer echten Seite und einer Falle erkennt, bevor diese Daten in deiner Datenbank landen.