← Alle Beiträge

Search, Agent, Training: Die neuen Bot-Regeln des Webs

Cloudflare sortiert Bots jetzt nach Zweck statt Verhalten: Search, Agent oder Training. Der Standard vom 15. September ist enger gefasst als die Panik vermuten lässt, und eine Checkbox fehlt.

Das Web sortiert Bots nach Zweck, nicht nach Verhalten

Jedes Bot-Erkennungssystem der letzten fünfzehn Jahre stellt eine einzige Frage: Sieht dieser Traffic automatisiert aus? Header-Reihenfolge, Fingerprints auf Protokollebene, Mausbewegungen, Session-Timing. All das versucht, anhand der Struktur des Requests Rückschlüsse auf den Client zu ziehen.

Am 1. Juli 2026 hat Cloudflare die Frage geändert. Bot-Traffic wird nun in drei Kategorien unterteilt, die nichts damit zu tun haben, wie ein Request auf der Leitung aussieht. Search umfasst "Crawler, die deine Inhalte indexieren, um später Fragen dazu zu beantworten." Agent umfasst "automatisierte Aktivitäten, die in Echtzeit im Auftrag einer Person handeln." Training umfasst "Crawler, die deine Inhalte nutzen, um ein Modell zu trainieren oder zu optimieren."

Stell dir drei Requests vor, die denselben Server erreichen. Derselbe Client, dieselben Header, dasselbe Timing, bis auf das Byte identisch. Nach diesem Modell können sie drei unterschiedliche Ergebnisse erhalten, die rein davon abhängen, was du mit der Seite nach dem Empfang vorhast.

Das ist kein besserer Detektor. Es ist ein anderes Primitiv.

Die Frist zum 15. September ist enger als die Panik

Die Version dieser Geschichte, die in Entwicklerforen kursiert, besagt, dass Cloudflare am 15. September KI-Agenten auf einem Fünftel des Webs blockiert.

Das Changelog besagt etwas deutlich Kleineres. Die neuen Standardeinstellungen gelten für "neue Domains, die bei Cloudflare eingerichtet werden." Auf diesen Domains werden "Bots, die als Training oder Agent eingestuft sind, auf werbefinanzierten Seiten blockiert, während Search erlaubt bleibt." Alle, die bereits bei Cloudflare sind, wählen ihre eigene Einstellung und können das jederzeit vor dem Stichtag tun.

Also: nur neue Domains, nur werbefinanzierte Seiten, und eine der drei Kategorien kommt standardmäßig weiterhin durch. Das ist eine spürbare Änderung, aber keine Mauer quer durch das Internet.

Der enge Rahmen ist jedoch der interessante Teil. Cloudflare hat keine Richtlinie veröffentlicht, sondern einen Standardwert, und über Standardwerte werden Richtlinien zur Norm, ohne dass jemand darüber abstimmt. Die entscheidende Zahl ist nicht der 15. September. Es ist die Anzahl dieser Domains, die die Einstellung danach nie wieder ändern.

Was das bedeutet: Wenn du Daten sammelst, lautet die relevante Frage nicht mehr "Komme ich durch den Schutz dieser Website?", sondern "In welcher Kategorie wähnt mich diese Website?". Diese Fragen haben unterschiedliche Antworten, und nur eine davon lässt sich testen.

Zweck lässt sich nicht messen. Er muss deklariert werden.

Hier ist das mechanische Problem bei der Sortierung von Traffic nach Absicht: Die Absicht steht nicht im Paket.

Ein Fingerprint lässt sich messen. Mausbewegungen lassen sich messen. "Warum rufst du diese Seite ab" lässt sich nicht messen, also muss der Client es explizit angeben, und das System braucht einen Grund, der Antwort zu glauben. Genau das ist die Aufgabe von Web Bot Auth. Der Agent signiert seine Requests mit einem Private Key, veröffentlicht ein Key-Verzeichnis, und die Edge verifiziert die Signatur dagegen, basierend auf RFC 9421 HTTP Message Signatures. Die Dokumentation von Cloudflare definiert die Anforderung für einen verifizierten Bot als "ehrliche Selbstidentifikation".

Schau dir nun an, was das Ganze im großen Maßstab durchsetzt. Die Spezifikation ist draft-meunier-webbotauth-httpsig-protocol-02, zuletzt überarbeitet am 18. August 2026. Angestrebter Status: Standards Track. Tatsächlicher Status: ein "Active Internet-Draft (individual)", der "vom IETF nicht unterstützt wird" und "keinen formellen Status im IETF-Standardisierungsprozess hat". Er hat zwei Autoren. Einer arbeitet bei Cloudflare, einer bei Google.

Wir halten das Design für richtig, und das sollte man betonen, bevor die Kritik einsetzt. Eine signierte Identität ist für jeden, der sich korrekt verhalten will, besser als das Wettrüsten mit Verifizierungsseiten. Ein Crawler, der sich identifiziert, kann gezielt zugelassen, gedrosselt oder abgerechnet werden, statt nur Vermutungen anzustellen, und Website-Betreiber erhalten eine Kontrolle, die echte Besucher nicht als Kollateralschaden blockiert. Vergleiche das mit einem Jahrzehnt voller IP-Bereichs-Blockaden auf gut Glück.

Was es nicht kann: jemanden aufhalten. Ein System, das auf deklarierten Absichten basiert, filtert nur den Traffic, der sich selbst deklariert. Alles andere fällt auf den bestehenden Detection-Stack zurück, und dieser Stack wird kontinuierlich schärfer: Cloudflares session-scoped behavioral scoring erschien zwölf Tage nach den neuen Kategorien.

Beide Ansätze konkurrieren also nicht. Identität filtert die Ehrlichen, Detection kümmert sich um den Rest, und dort landet dein Traffic standardmäßig, wenn du dich nie deklarierst.

Es gibt keine passende Schublade für das Sammeln öffentlicher Daten

Nun zu dem Punkt, der jeden stören sollte, der eine Collection-Pipeline betreibt.

Nimm die Projekte, die wir dieses Jahr veröffentlicht haben. Einen Holzpreis-Index, der auf öffentlichen Inseraten basiert. MAP-Verletzungserkennung auf sechs Marktplätzen, was bedeutet, dieselbe Produktseite von sechs verschiedenen Standorten abzurufen und die Ergebnisse zu vergleichen. App-Store-Rankings und Review-Sentiment. Überprüfungen von Ad-Platzierungen direkt aus dem Land, in dem die Kampagne tatsächlich gebucht wurde.

Ordne das mal unter Search, Agent oder Training ein.

Search passt nicht: Cloudflares eigene Definition verknüpft dies mit der Erwartung von "Referral-Traffic oder einer anderen angemessenen Gegenleistung", und ein nächtlicher Preisabgleich schickt niemandem Referrals. Agent passt ebenfalls nicht, da kein Mensch vor einem Bildschirm sitzt und auf diesen Fetch wartet. Und Training ist schlichtweg falsch, da nichts in ein Modell einfließt.

Dies ist eine Taxonomie, die verfasst wurde, um den KI-Traffic der letzten drei Jahre zu beschreiben, und die nun auf ein Geschäftsmodell angewendet wird, das ein Jahrzehnt älter ist. Price Intelligence, Alternative Data, SERP-Tracking, Brand Protection, Ad Verification, Compliance-Monitoring: Nichts davon ist neu, nichts davon ist agentisch und für nichts davon gibt es ein passendes Kästchen zum Ankreuzen.

Traffic ohne eigenes Kästchen wird von demjenigen einsortiert, der die Kästchen gezeichnet hat. Meistens in das nächstbeste.

Was das für Data-Teams bedeutet

Vier Dinge, die sich lohnen, solange die Regeln noch formbar sind.

Entscheide, welche Kategorie du ehrlich beanspruchen kannst. Nicht die, mit der du durch die Tür kommst. Sondern die, die du schriftlich verteidigen würdest, wenn ein Publisher dich direkt fragt. Wenn die ehrliche Antwort "keine davon" lautet, gehörst du zu der Gruppe, die am meisten zu verlieren hat, sobald sich die Taxonomie verfestigt, und die am meisten gewinnt, wenn sie das anspricht, solange noch Raum für Diskussionen ist.

Lies die Einstellungen des Ziels, nicht die Schlagzeilen. Die Bot-Policy einer Site ist jetzt eine Eigenschaft dieser Site, konfigurierbar pro Pfad, und sie ändert sich ohne Vorankündigung. Wenn du "Cloudflare blockiert Agents im September" als allgemeingültigen Fakt für deine Pipeline behandelst, wirst du Dinge umbauen, die nie gefährdet waren.

Gehe davon aus, dass sich der Werbeseiten-Test ausbreitet. Cloudflare hat seinen Standard an Seiten gekoppelt, die Werbung anzeigen, ein brauchbarer Indikator für "diese Seite verdient Geld mit menschlicher Aufmerksamkeit". Diese Grenze wird sich verschieben, und Cloudflare ist nicht der Einzige, der sie zieht. AWS WAF hat am 15. Juni 2026 AI-Traffic-Monetarisierung eingeführt und antwortet mit einem 402-Statuscode sowie maschinenlesbaren Zahlungsbedingungen. Akamai wählte den Partnerschaftsweg mit TollBit und Skyfire. Drei der größten Edge-Provider verkaufen nun dieselbe Kontrollfläche, die wir aus Preissicht analysiert haben, als Pay-per-Crawl gestartet ist.

Sorge dafür, dass deine Datenerfassung auf beiden Wegen funktioniert. Der identifizierte Weg (signieren, deklarieren, zugelassen werden oder zahlen) und der nicht identifizierte Weg (nach Verhalten beurteilt werden, wie eh und je) werden über Jahre hinweg nebeneinander existieren. So zu bauen, als gäbe es nur einen davon, ist der teure Fehler, und zwar in beide Richtungen.

Die Kästchen werden neu gezeichnet

Eine Prognose, an der wir uns gerne messen lassen: Innerhalb eines Jahres taucht eine vierte Kategorie auf.

Die erste Version jeder Taxonomie schreibt derjenige, der unter Druck steht. Diejenigen, die klassifiziert werden, sitzen dabei nicht am Tisch. Search, Agent und Training beschreiben, was KI-Unternehmen mit Publishern machen. Sie beschreiben kein Marktforschungsunternehmen, kein Compliance-Team und keinen Händler, der die Preise von Mitbewerbern prüft. Und diese drei rufen öffentliche Seiten schon höflich ab, lange bevor "Agent" in diesem Kontext überhaupt eine Bedeutung hatte.

Der Streit darum, wie diese vierte Kategorie heißt und wer sie auswählen darf, wird für die Datenbranche wichtiger sein als jeder Bot-Detection-Benchmark dieses Jahres. Bei dieser Debatte lohnt es sich, dabei zu sein.

Denn der Fallback ist simpel. Wenn du deinen Traffic nicht selbst benennen kannst, übernimmt das jemand anderes für dich.