Am 19. Februar 2026 machten Stack Overflow und Cloudflare etwas öffentlich, das die meisten in der Webdaten-Branche nicht kommen sahen. Sie haben Pay-per-Crawl gemeinsam gestartet: ein System, bei dem KI-Crawler eine 402 Payment Required-Antwort in Echtzeit erhalten und entweder den Preis des Publishers zahlen oder abziehen können. Die Bot-Identität wird am Edge verifiziert, der Preis wird von der Website festgelegt, die Transaktion wird gemessen.
Cloudflare steht vor etwa jeder fünften Website im Internet. Als sie die Standard-Blockierung für bekannte KI-Bots aktivierten und einen Marktplatz einrichteten, auf dem Publisher pro Request abrechnen, änderte sich das Zugriffsmodell für einen riesigen Teil des offenen Webs an einem einzigen Wochenende.
Wenn du gerade Webdaten-Infrastruktur entwickelst, ist das keine Cloudflare-Ankündigung zum einfachen Abheften. Es verändert die Rechnung dessen, was "offen" bedeutet.
Die Mechanik hinter dem Wechsel
Der technische Schritt ist klein. Cloudflare hat HTTP 402 reaktiviert, den lange ungenutzten Statuscode "Payment Required", und ihn an ein Register verifizierter KI-Crawler angebunden. Ein Publisher legt einen Preis pro Request fest. Der Crawler verfügt entweder über ein Guthaben und zahlt, oder er wird blockiert.
Der nicht-technische Schritt ist größer. Zuvor waren die einzigen Wege, um "scrape meine Inhalte nicht für KI" durchzusetzen, robots.txt (empfehlend, nicht erzwungen) und aggressives Bot-Blocking (binär, verlustbehaftet und voller False Positives). Cloudflare hat eine dritte Option hinzugefügt: ein Preisschild.
Die Ökonomie dieser dritten Option funktioniert anders als bei den ersten beiden. Robots.txt kostet nichts und wird ignoriert. Bot-Blocking kostet dich Traffic von echten Nutzern, die fälschlicherweise als Bots eingestuft werden. Ein Preisschild trennt konstruktionsbedingt Crawler, die bereit sind zu zahlen, von denen, die es nicht sind.
Wer tatsächlich Gebühren verlangt
Stack Overflow war der Launch-Partner, weil ihre Trainingsdaten echten Wert haben und sie bereits bilaterale Deals mit OpenAI und anderen verhandelten. Der Marktplatz von Cloudflare hat diese bilateralen Deals in ein Register generalisiert, an das sich der Rest der Publisher-Welt anbinden kann.
Die Liste der Nachfolger wuchs schnell. AWS lieferte eine eigene Schicht zur Bot-Monetarisierung aus. Akamai baute eine parallele Lösung. Der Pitch für Publisher ist einfach: Statt einer teuren Klage gegen ein KI-Labor erhält man eine Einnahmequelle, die pro Request zahlt.
Vorerst betrifft das hauptsächlich die Kategorie hochwertiger Inhalte: Dokumentationen, Nachrichten, technische Q&As, strukturierte Referenzdaten. Der Long Tail des Webs (kleine E-Commerce-Websites, regionale Branchenverzeichnisse, Nischenforen) steht hinter keinem solchen Gate und wird es wahrscheinlich nie tun. Das Bot Management von Cloudflare kostet im Betrieb Geld, und Pay-per-Crawl ist opt-in. Es lohnt sich nur für Websites, bei denen ein einzelner Seitenaufruf es wert ist, berechnet zu werden.
Was das für Webdaten-Pipelines bedeutet
Wenn du eine Pipeline baust, die Daten von Stack Overflow, großen Nachrichtenseiten oder anderen Publishern zieht, die aktiv einsteigen, schrumpfen deine Optionen auf drei. Zahle über den Marketplace, sobald dein Traffic als AI-Crawler identifizierbar ist. Wechsle zu einem lizenzierten Datensatz, sofern vorhanden. Oder finde die Daten dort, wo sie noch frei zugänglich sind.
Die meisten Teams werden letztlich zu unterschiedlichen Zeiten alle drei Wege nutzen. Das ist die praktische Realität. Das Web spaltet sich in lizenzierte und offene Bereiche, und die Grenze verläuft nicht sauber entlang von Domain-Grenzen. Derselbe Publisher kann einen Bereich hinter 402 sperren und einen anderen offen lassen. Dieselbe Site kann von einem Crawler Geld verlangen und einen Research-Bot komplett ignorieren.
Unserer Ansicht nach sieht die praktische Reaktion für Engineering-Teams so aus: Erstens: Auditiere deine Quellen. Wenn ein relevanter Teil deiner Pipeline Daten von Stack Overflow, Reddit, großen Nachrichtenseiten oder einem der vielen Publisher bezieht, die solche Deals anstreben, gehe davon aus, dass sich das Zugriffsmodell innerhalb von zwölf Monaten ändert. Zweitens: Trenne lizenzierte Quellen frühzeitig in deiner Architektur von offenen Quellen. Eine Pipeline, die jede Quelle identisch behandelt, ist anfällig, wenn die eine Hälfte plötzlich Geld verlangt und die andere nicht. Drittens: Höre auf, robots.txt als einziges Signal zu behandeln. Die 402 Response hat operative Konsequenzen, selbst wenn dein Crawler kein AI-Agent ist. False Positives sind in einem so neuen System unvermeidlich.
Dies steht neben dem Compliance-Druck für Trainingsdaten durch den EU AI Act, der Teams ohnehin zu Quellen mit Herkunftsnachweis drängt. Pay-per-Crawl ist derselbe Druck, nur mit einer Abrechnungsebene versehen.
Ein ehrlicher Ausblick
Einige Punkte werden für Stolpersteine sorgen. Die Identitätsprüfung von Cloudflare basiert darauf, dass sich Bots registrieren. Bots, die sich nicht registrieren oder wie Residential-Traffic aussehen, lösen 402 gar nicht erst aus. Sie treffen stattdessen auf die normale Bot-Erkennung. Das ist ohnehin der Weg, den die meisten aggressiven AI-Crawler wählen werden. Pay-per-Crawl funktioniert also für Bots, die kooperieren wollen. Diejenigen, die das nicht tun, hätten ohnehin nie die robots.txt beachtet.
Die größere Verschiebung liegt womöglich gar nicht im Marketplace selbst. Sie liegt darin, dass die Frage „Dürfen diese Inhalte für AI-Training genutzt werden?“ jetzt vertraglich beantwortet wird statt durch Raten via robots.txt. Publisher können Regeln endlich durchsetzen. Crawler haben endlich Klarheit. Die Grauzone schrumpft dort, wo der Marketplace greift.
Grauzone bleibt alles außerhalb davon. Die kleine Website ohne Cloudflare, der regionale Aggregator ohne AI-Strategie, der Long Tail des Webs, über den niemand verhandelt: Sie erhalten weder einen 402 noch einen Lizenzdeal. Sie behalten ihre bisherige Zugriffspolitik bei, protestieren jetzt aber lauter, da es einen Präzedenzfall für Vergütung gibt.
Wohin die Entwicklung geht
Zwei Prognosen, und sie sind keineswegs risikolos.
Erstens: In den nächsten zwölf Monaten wird eine zweite Paywall-Stufe entstehen, diesmal für Nicht-AI-Bots. Der Marktplatz-Mechanismus ist lediglich ein HTTP-Statuscode und ein Billing-Layer. Es ist technisch nicht schwer, das auf Preise für Such-Crawler, Archiv-Bots oder Mitbewerber-Monitoring auszuweiten. Ob Publisher die Grenze halten und nur AI-Crawler monetarisieren, hängt vom Verhalten der nächsten Welle ab. Meistens bricht diese Grenze.
Zweitens: AI-Labs werden das umgehen. Nicht durch Ignorieren des 402 (das ist nachverfolgbar und wird juristisch verfolgt), sondern durch den kaufmännischen Großeinkauf lizenzierter Datensätze, während der gesamte Rest über Traffic läuft, der wie echte Nutzer aussieht. Cloudflare rollt genau deshalb bereits mehr verhaltensbasierte Erkennung aus. Wir haben beobachtet, wie sich dieses Wettrüsten seit zwei Jahren auf Signale auf Session-Ebene verlagert. Das endet nicht mit einem Marktplatz.
Die spannende Frage für Entwickler ist nicht, ob man zahlt. Sondern wo das offene Web offen bleibt, und wie lange.