← Alle Beiträge

Bot-Erkennung ist nun verhaltensbasiert. Die meisten Scraper nicht.

Bot-Erkennung hat sich von IP-Blocking zu TLS-Fingerprints, Browser-Signalen und Verhaltensanalyse verschoben. Die meisten Scraping-Setups kämpfen den falschen Kampf.

Im Januar bewiesen 16 Millionen Requests, dass IP-Blocking tot ist

Ein Scalping-Angriff traf im Januar 2026 eine große E-Commerce-Plattform. 16 Millionen Requests verteilten sich auf 3,9 Millionen eindeutige IP-Adressen. Rate-Limiting pro IP war machtlos. Der Angriff war nicht wegen cleverem Code erfolgreich. Er funktionierte, weil die schiere Masse an IPs traditionelle Erkennung nutzlos machte (SecurityBoulevard, März 2026).

Dieser Vorfall bewies, was die Bot-Detection-Branche schon länger sagt: IP-Reputation allein unterscheidet keine Menschen von Bots. Und wenn die Verteidiger weitergezogen sind, müssen Scraper das auch tun.

Die drei Layer, die IP-Blocking ersetzt haben

Moderne Bot-Detection arbeitet auf drei Layern. Nur der erste betrifft deine IP.

Connection Fingerprinting. Bevor dein Request den Server erreicht, enthält bereits das allererste Paket deiner Verbindung ein klares Muster, das die anfragende HTTP-Bibliothek identifiziert. Pythons requests-Bibliothek, Gos Standard-Client, Node.js fetch, jeder erzeugt einen eindeutigen Fingerprint. Bot-Detection-Systeme prüfen dies, bevor sie auch nur einen einzigen Header lesen. Passt deine Signatur nicht zu einem echten Browser, wirst du auf Connection-Ebene blockiert (Reddit r/programming).

Browser Fingerprinting. Websites prüfen heute über 300 Signale aus der Browser-Umgebung. Canvas-Rendering, WebGL-Output, AudioContext, installierte Schriftarten, Bildschirmauflösung, Zeitzone, GPU-Infos. Dein User-Agent-String ist das uninteressanteste Signal im Stack. Cloudflare, Akamai und DataDome erfassen diese Daten passiv über JavaScript-Challenges, die vor dem Laden der Seite laufen.

Verhaltensanalyse. Das ist der neueste Layer und am schwersten zu fälschen. Bot-Detection-Systeme tracken Mausbewegungen, Scroll-Geschwindigkeit, Klickmuster, Tipprhythmus und das Timing zwischen Interaktionen. Echte Menschen bewegen die Maus nicht in perfekt geraden Linien. Sie pausieren, zielen an Buttons vorbei, scrollen unregelmäßig. Bots tun nichts davon oder machen alles zu perfekt (r/webdev, 2026).

Die meisten Scraping-Teams kämpfen an der falschen Front

Hier ist die unbequeme Wahrheit: Die meisten Scraping-Teams investieren immer noch primär in IP-Infrastruktur. Größere Proxy-Pools, Residential-IPs, rotierende Gateways. Das hat seine Berechtigung. IP-Reputation zählt weiterhin als ein Signal unter vielen.

Aber der Kauf von 10.000 Residential-IPs hilft nicht, wenn dein Connection-Fingerprint nach "Python-Skript" schreit oder dein Headless-Browser Automatisierungs-Flags über navigator.webdriver leakt. Du gibst Geld auf dem falschen Layer aus.

Ein Entwickler, der 34 Scraper für Produktivsysteme gebaut hat, beschrieb das Problem so (Dev|Journal, März 2026): Die Lücke zwischen Scraping auf Tutorial-Niveau und produktionsreifen Lösungen entsteht durch Bot-Detection-Systeme, die Verbindungs-Fingerprints und Mausbewegungen analysieren, anstatt DOM-Selektoren. Tutorials zeigen dir, wie man HTML parst. Die Produktion bringt dir bei, die Detection zu überleben.

Und die Lage verschärft sich. Der State of Web Scraping 2026 Report von Browserless zeigt, dass standardmäßige Headless-Browser häufiger blockiert werden als echte Browser, da Bot-Detection-Systeme die spezifischen Fingerprint-Unterschiede zwischen Headless- und Headed-Browser-Instanzen genau katalogisiert haben. Die Lücke schrumpft nicht.

Wenn dein Scraper ständig abbricht und du dich nur auf Proxy-Rotation konzentrierst, setzt du womöglich am völlig falschen Punkt an.

Der Cloudflare-Faktor

Cloudflare verdient besondere Erwähnung, da sie auf beiden Seiten dieses Wandels stehen.

Ihr Bot-Management-Produkt führt bei jedem Request Verhaltensanalysen durch und bewertet Besucher auf einer Skala von 1 bis 99 anhand von Dutzenden Signalen. Turnstile (ihre unsichtbare Challenge) passt den Schwierigkeitsgrad dynamisch daran an, wie menschlich der Besucher wirkt (Cloudflare Docs).

Gleichzeitig startete Cloudflare eine eigene KI-Crawling-Infrastruktur. Die Community bemerkte die Ironie (Reddit r/cybersecurity).

In der Praxis bedeutet das: Durch Cloudflare geschützte Seiten sind 2026 am schwersten zu scrapen, und rund 20 % aller Websites liegen hinter ihrem Netzwerk. Wenn deine Scraping-Strategie verhaltensbasierte Erkennung ignoriert, verlierst du ein Fünftel des erreichbaren Webs.

Was 2026 tatsächlich funktioniert

Erfolgreiche Scraper teilen drei Eigenschaften.

Erstens entsprechen sie auf Wire-Ebene der Signatur eines aktuellen Browsers. Die genaue Byte-Struktur der Verbindung muss dem entsprechen, was eine aktuelle Chrome- oder Firefox-Session erzeugt. Kein Header-Spoofing der Welt behebt einen abweichenden Verbindungs-Fingerprint.

Zweitens nutzen sie echte (oder überzeugend echte) Browserumgebungen. Keine Headless-Instanzen mit Standardeinstellungen. Tatsächliche Browser-Instanzen mit konsistenten Fingerprints, die zum angegebenen User-Agent passen.

Drittens fügen sie für geschützte Seiten menschenähnliches Rauschen im Verhalten hinzu. Zufällige Delays reichen nicht aus. Die Abstände zwischen Aktionen müssen realistischen Verteilungen folgen, und Mauspfade brauchen Kurven und Verzögerungen, die organisch wirken.

Die Architektur hat sich also verändert. Es geht nicht um mehr IPs. Es geht darum, jeden Request ununterscheidbar von einem echten Menschen in einem echten Browser zu machen.

Das Erkennungs-Wettrüsten beschleunigt sich

Anbieter von Bot-Detection teilen Bedrohungsdaten in Echtzeit über ihre gesamte Kundenbasis. Wenn eine Website ein neues Bot-Muster erkennt, lernt jede andere Site im Netzwerk innerhalb von Minuten dazu (SecurityBoulevard, März 2026). Das ist eine grundlegende Änderung gegenüber dem alten Modell, bei dem die Abwehrmechanismen jeder Site unabhängig voneinander arbeiteten.

Wir gehen davon aus, dass die Kosten für selbst erstellte Scraping-Infrastruktur weiter steigen werden. Jedes neue Erkennungssignal erfordert Entwicklungszeit zur Abwehr, und der Zyklus wird schneller. Teams, die Erkennung auf Infrastrukturebene angehen (smartes Proxy-Routing, Browser-Fingerprinting, Abgleich auf Verbindungsebene), werden besser abschneiden als jene, die das Problem nur mit mehr IPs lösen wollen.

Die Frage ist nicht, ob du mehr Proxys brauchst. Sie ist, ob deine Requests menschlich aussehen, bevor sie den Zielserver überhaupt erreichen.