19 lutego 2026 roku Stack Overflow i Cloudflare ogłosiły publicznie coś, czego większość branży danych internetowych się nie spodziewała. Obie firmy wspólnie uruchomiły model pay-per-crawl: system, w którym crawlery AI otrzymują w czasie rzeczywistym odpowiedź 402 Payment Required i mogą zapłacić stawkę wydawcy albo zrezygnować. Tożsamość bota jest weryfikowana na brzegu sieci (edge), cenę ustala serwis, a transakcja jest rozliczana na bieżąco.
Cloudflare obsługuje ruch dla około jednej piątej witryn w internecie. Kiedy więc włączyli domyślne blokowanie znanych botów AI i uruchomili giełdę, na której wydawcy pobierają opłaty za request, model dostępu do ogromnej części otwartego internetu zmienił się w jeden weekend.
Jeśli budujesz teraz infrastrukturę danych webowych, to nie jest zwykłe ogłoszenie Cloudflare, które można zignorować. Zmienia ono rachunek tego, co oznacza „otwarty”.
Mechanizm stojący za zmianą
Od strony technicznej zmiana jest niewielka. Cloudflare wskrzesiło HTTP 402, dawno uśpiony kod statusu „Payment Required”, i połączyło go z rejestrem zweryfikowanych crawlerów AI. Wydawca ustala cenę za request. Crawler ma środki na koncie i płaci, albo zostaje zablokowany.
Ruch nietechniczny ma większe znaczenie. Wcześniej jedynymi sposobami na egzekwowanie zasady „nie pobieraj moich treści dla AI” były robots.txt (niewiążący, nieegzekwowany) oraz agresywne blokowanie botów (binarne, stratne i generujące mnóstwo false positives). Cloudflare dodało trzecią opcję: cennik.
Ekonomia tej trzeciej opcji działa inaczej niż pierwszych dwóch. Plik robots.txt nic nie kosztuje i jest ignorowany. Blokowanie botów kosztuje utratę ruchu od prawdziwych użytkowników błędnie sklasyfikowanych jako boty. Cennik z założenia oddziela crawlery gotowe zapłacić od tych, które płacić nie chcą.
Kto faktycznie pobiera opłaty
Stack Overflow było partnerem startowym, ponieważ ich dane treningowe mają realną wartość, a firma prowadziła już dwustronne negocjacje z OpenAI i innymi podmiotami. Marketplace od Cloudflare przekształcił te bilateralne umowy w ogólny rejestr, do którego może podłączyć się reszta wydawców.
Lista kolejnych podmiotów szybko urosła. AWS wdrożył własną warstwę monetyzacji botów. Akamai zbudowało równoległe rozwiązanie. Przekaz dla wydawców jest prosty: zamiast kosztownego procesu sądowego przeciwko laboratorium AI, zyskujesz strumień przychodów rozliczany za request.
Na razie dotyczy to głównie treści o wysokiej wartości: dokumentacji, wiadomości, technicznych Q&A oraz ustrukturyzowanych danych referencyjnych. Długi ogon internetu (małe sklepy e-commerce, lokalne ogłoszenia, fora niszowe) nie stosuje takich barier i prawdopodobnie nigdy nie będzie. Zarządzanie botami w Cloudflare kosztuje, a model pay-per-crawl wymaga włączenia. Opłaca się to tylko w witrynach, gdzie pojedyncze wyświetlenie strony ma wymierną wartość.
Co to oznacza dla pipeline'ów danych internetowych
Jeśli budujesz pipeline pobierający dane ze Stack Overflow, głównych serwisów informacyjnych lub od dowolnego z wydawców aktywnie dołączających do programu, twoje opcje zawężają się do trzech. Płać przez marketplace, gdy twój ruch zostanie zidentyfikowany jako AI crawler. Przejdź na licencjonowany zbiór danych, jeśli taki istnieje. Albo znajdź dane tam, gdzie nadal są otwarte.
Większość zespołów skończy na stosowaniu wszystkich trzech rozwiązań w różnym czasie. Taka jest praktyczna rzeczywistość. Sieć dzieli się na licencjonowaną i otwartą, a granica nie przebiega równo wzdłuż domen. Ten sam wydawca może mieć jedną sekcję za błędem 402, a inną otwartą. Ta sama witryna może pobierać opłaty od jednego crawlera, a bota badawczego całkowicie ignorować.
Uważamy, że praktyczna reakcja zespołów inżynieryjnych wygląda następująco. Po pierwsze, przeprowadź audyt swoich źródeł. Jeśli znacząca część twojego pipeline pobiera dane ze Stack Overflow, Reddita, głównych serwisów informacyjnych lub od któregokolwiek z kilkunastu wydawców widocznie dążących do takich umów, załóż, że model dostępu zmieni się w ciągu dwunastu miesięcy. Po drugie, wcześnie rozdziel źródła licencjonowane od otwartych w swojej architekturze. Pipeline traktujący każde źródło identycznie staje się kruchy, gdy połowa z nich zaczyna żądać pieniędzy, a druga połowa nie. Po trzecie, przestań traktować robots.txt jako jedyny sygnał. Odpowiedź 402 będzie miała znaczenie operacyjne, nawet jeśli twój crawler nie jest agentem AI. Wyniki fałszywie dodatnie są nieuniknione w tak nowym systemie.
Wiąże się to z presją na zgodność danych treningowych wynikającą z EU AI Act, która już popchnęła zespoły w stronę źródeł ze śledzeniem pochodzenia (provenance). Pay-per-crawl to ta sama presja, tylko z dołączoną warstwą bilingową.
Szczera ocena
Kilka rzeczy sprawi ludziom trudność. Weryfikacja tożsamości w Cloudflare opiera się na rejestracji botów. Boty, które się nie zarejestrują lub które wyglądają jak ruch residential, w ogóle nie wywołują 402. Zamiast tego trafiają na standardową detekcję botów. To już jest ścieżka, którą wybierze większość agresywnych crawlerów AI. Model pay-per-crawl działa więc dla botów, które chcą zachować zgodność. Te, które tego nie chcą, i tak nigdy nie respektowałyby robots.txt.
Większą zmianą może nie być sam marketplace. Jest nią fakt, że pytanie "czy ta treść jest dostępna do trenowania AI" zyskało odpowiedź kontraktową zamiast zgadywania na podstawie robots.txt. Wydawcy mogą wreszcie egzekwować zasady. Crawlery mogą wreszcie mieć pewność. Szara strefa kurczy się tam, gdzie sięga marketplace.
To, co pozostaje szare, to wszystko poza nim. Mała witryna bez Cloudflare, regionalny agregator bez strategii AI, długi ogon sieci, o który nikt nie negocjuje: one nie zwracają 402 i nie dostają też umów licencyjnych. Zachowują taką politykę dostępu, jaką miały wcześniej, tyle że z głośniejszym sprzeciwem, skoro istnieje już precedens rekompensaty.
Dokąd to zmierza
Dwie prognozy, i nie są one zachowawcze.
Po pierwsze: w ciągu najbliższych dwunastu miesięcy pojawi się drugi poziom paywalli, tym razem dla botów niezwiązanych z AI. Mechanizm rynkowy to po prostu kod statusu HTTP i warstwa rozliczeniowa. Rozszerzenie go na cenniki dla crawlerów wyszukiwarek, botów archiwizujących czy monitoringu konkurencji nie stanowi problemu technicznego. To, czy wydawcy utrzymają zasadę pobierania opłat wyłącznie od crawlerów AI, zależy od zachowania kolejnej fali. Zazwyczaj taka granica szybko pęka.
Po drugie: laboratoria AI znajdą obejście. Nie poprzez ignorowanie kodu 402 (to łatwe do wykrycia i obarczone ryzykiem procesów), lecz kupując hurtowo licencjonowane zbiory danych, a całą resztę przepuszczając przez ruch przypominający prawdziwych użytkowników. Cloudflare wdraża coraz więcej mechanizmów detekcji behawioralnej właśnie dlatego, że o tym wie. Od dwóch lat obserwujemy, jak ten wyścig zbrojeń przenosi się na sygnały na poziomie sesji. Marketplace tego nie zakończy.
Ciekawe pytanie dla twórców nie brzmi, czy płacić. Kluczowe jest to, które obszary otwartego internetu pozostaną otwarte i na jak długo.