← Wszystkie wpisy

Search, Agent, Training: nowe reguły dla botów w sieci

Cloudflare dzieli teraz boty według celu, a nie zachowania: Search, Agent lub Training. Domyślne ustawienie z 15 września jest węższe niż wywołana panika i brakuje w nim jednej opcji.

Sieć zaczyna dzielić boty według celu, a nie zachowania

Każdy system detekcji botów stworzony w ciągu ostatnich piętnastu lat zadaje jedno pytanie: czy ten ruch wygląda na zautomatyzowany? Kolejność nagłówków, fingerprinty na poziomie sieci, ruchy myszą, timing sesji. Wszystko to próbuje wywnioskować coś o kliencie na podstawie kształtu żądania.

1 lipca 2026 roku Cloudflare zmieniło to pytanie. Ruch botów dzieli się teraz na trzy kategorie, które nie mają nic wspólnego z tym, jak request wygląda na poziomie sieci. Search obejmuje "crawlery, które indeksują treść, aby móc później odpowiadać na pytania na jej temat." Agent obejmuje "zautomatyzowane działania wykonywane w czasie rzeczywistym w imieniu użytkownika." Training obejmuje "crawlery, które pobierają treść w celu trenowania lub dostrajania modeli."

Wyobraź sobie trzy żądania docierające do tego samego serwera. Ten sam klient, te same nagłówki, ten sam timing, identyczne co do bajta. W tym modelu mogą otrzymać trzy różne werdykty, zależne wyłącznie od tego, co planujesz zrobić ze stroną po jej pobraniu.

To nie jest lepszy detektor. To zupełnie inny mechanizm bazowy.

Termin 15 września jest węższy niż wywołana panika

Wersja tej historii krążąca po forach programistycznych mówi, że 15 września Cloudflare zablokuje agentów AI na jednej piątej sieci.

Changelog mówi o czymś znacznie mniejszym. Nowe ustawienia domyślne dotyczą "nowych domen dołączających do Cloudflare." Na tych domenach "boty sklasyfikowane jako Training lub Agent są blokowane na stronach wyświetlających reklamy, podczas gdy kategoria Search pozostaje dozwolona." Każdy, kto już korzysta z Cloudflare, wybiera własne ustawienia i może to zrobić w dowolnym momencie przed tą datą.

A więc: tylko nowe domeny, tylko strony z reklamami, a jedna z trzech kategorii nadal przechodzi domyślnie. To realna zmiana, ale nie jest to blokada całego internetu.

Ciekawy jest jednak ten wąski zakres. Cloudflare nie opublikowało nowej polityki, opublikowało ustawienie domyślne, a to właśnie wartości domyślne stają się normą bez żadnego głosowania. Liczba warta uwagi to nie 15 września. Chodzi o to, ile z tych domen nigdy później nie zmieni tego ustawienia.

Co to oznacza: jeśli zbierasz dane, kluczowym pytaniem przestało być "czy przejdę przez zabezpieczenia tej strony", a stało się "do której kategorii ta strona mnie zalicza". Na te pytania odpowiada się inaczej i tylko jedno z nich da się bezpośrednio przetestować.

Celu nie da się zmierzyć. Trzeba go zadeklarować.

Oto problem techniczny z podziałem ruchu według intencji: intencji nie ma w pakiecie.

Fingerprint można zmierzyć. Ruch myszy można zmierzyć. Pytania "dlaczego pobierasz tę stronę" nie da się zmierzyć, więc system wymaga, aby klient zadeklarował to wprost, oraz potrzebuje powodu, by tej odpowiedzi zaufać. To właśnie zadanie dla Web Bot Auth. Agent podpisuje swoje requesty kluczem prywatnym, publikuje katalog kluczy, a brzeg sieci (edge) weryfikuje podpis na jego podstawie, w oparciu o RFC 9421 HTTP Message Signatures. Dokumentacja Cloudflare definiuje zweryfikowanego bota jako takiego, który stosuje "uczciwą samoidentyfikację".

Spójrzmy teraz na to, co egzekwuje ten mechanizm na dużą skalę. Specyfikacja to draft-meunier-webbotauth-httpsig-protocol-02, ostatnio zmieniona 18 sierpnia 2026 r. Docelowy status: Standards Track. Rzeczywisty status: "Active Internet-Draft (individual)", który "nie jest zatwierdzony przez IETF" i "nie ma formalnego statusu w procesie standaryzacji IETF". Ma dwóch autorów. Jeden pracuje w Cloudflare, drugi w Google.

Uważamy, że sama koncepcja jest właściwa, i warto to podkreślić, zanim przejdziemy do krytyki. Podpisana tożsamość wygrywa z wyścigiem zbrojeń na stronach weryfikacyjnych dla każdego, kto zamierza działać w dobrej wierze. Crawler, który sam się identyfikuje, może być świadomie dopuszczony, ograniczony rate limitem lub rozliczany, zamiast być przedmiotem domysłów, a właściciele stron zyskują kontrolę, która nie uderza rykoszetem w prawdziwych użytkowników. Warto to zestawić z dekadą blokowania zakresów IP i liczenia na szczęście.

To rozwiązanie nie jest jednak w stanie nikogo powstrzymać. System oparty na deklarowanym celu klasyfikuje wyłącznie ten ruch, który sam składa deklarację. Cała reszta trafia z powrotem do dotychczasowego stosu detekcji, a ten staje się coraz bardziej precyzyjny: scoring behawioralny w zakresie sesji (session-scoped behavioral scoring) od Cloudflare został wdrożony dwanaście dni po wprowadzeniu nowych kategorii.

Oba rozwiązania ze sobą nie konkurują. Tożsamość porządkuje uczciwych, detekcja zajmuje się resztą, a ten drugi mechanizm jest domyślnym miejscem docelowym dla twojego ruchu, jeśli niczego nie zadeklarujesz.

Brak kategorii dla zbierania danych publicznych

A teraz kwestia, która powinna zaniepokoić każdego, kto utrzymuje pipeline do scrapingu danych.

Weźmy projekty, które opublikowaliśmy w tym roku. Indeks cen drewna zbudowany na bazie publicznych ofert. Wykrywanie naruszeń polityki MAP na sześciu platformach e-commerce, co oznacza pobieranie tej samej strony produktu z sześciu różnych lokalizacji i porównywanie wyników. Rankingi w app store i analiza sentymentu opinii. Weryfikacja emisji reklam prowadzona z kraju, w którym kampania została faktycznie zakupiona.

Spróbuj przypisać te zadania do kategorii Search, Agent lub Training.

Search nie pasuje: sama definicja Cloudflare zakłada oczekiwanie "ruchu odsyłającego lub innej godziwej rekompensaty w zamian", a nocne sprawdzanie cen nie odsyła nikogo. Agent również nie pasuje, ponieważ żaden człowiek nie siedzi przed ekranem, czekając na wynik tego żądania. Z kolei Training jest po prostu błędny, bo nic nie trafia do modelu.

To taksonomia stworzona do opisania ruchu AI, który pojawił się w ciągu ostatnich trzech lat, a teraz jest stosowana do branży istniejącej dekadę wcześniej. Price intelligence, alternative data, monitoring SERP, ochrona marki, weryfikacja reklam, monitoring zgodności: nic z tego nie jest nowe, nic z tego nie jest agentowe i na nic z tego nie ma odpowiedniej opcji do zaznaczenia.

Ruch bez przypisanej kategorii jest klasyfikowany przez tego, kto te kategorie stworzył. Zazwyczaj trafia do najbliższej pasującej.

Co to oznacza dla zespołów danych

Cztery rzeczy, które warto zrobić, dopóki reguły są jeszcze elastyczne.

Zdecyduj, do której kategorii szczerze należysz. Nie do tej, która pozwala przejść przez zabezpieczenia. Do tej, której obronisz na piśmie, gdy wydawca zapyta wprost. Jeśli uczciwa odpowiedź brzmi "do żadnej z nich", jesteś w grupie, która straci najwięcej, gdy taksonomia okrzepnie, i zyska najwięcej, mówiąc o tym głośno, dopóki trwa dyskusja.

Sprawdzaj ustawienia celu, a nie nagłówki. Polityka dotycząca botów jest teraz właściwością konkretnej witryny, konfigurowalną dla każdej ścieżki i zmieniającą się bez uprzedzenia. Traktowanie hasła "Cloudflare blokuje agentów we wrześniu" jako faktu dotyczącego twojego pipeline'u sprawi, że zaczniesz przebudowywać elementy, które nigdy nie były zagrożone.

Załóż, że test stron z reklamami się rozprzestrzeni. Cloudflare powiązało swoje domyślne reguły ze stronami wyświetlającymi reklamy, co stanowi przyzwoity wskaźnik dla zasady "ta strona zarabia na uwadze człowieka". Ta granica się przesunie, a Cloudflare nie jest jedynym podmiotem, który ją wyznacza. AWS WAF wdrożył monetyzację ruchu AI 15 czerwca 2026 roku, odpowiadając kodem 402 i maszynowo czytelnymi warunkami płatności. Akamai wybrało drogę partnerstwa z TollBit i Skyfire. Trzej najwięksi dostawcy usług brzegowych sprzedają teraz ten sam mechanizm kontroli, który analizowaliśmy od strony cenowej w momencie uruchomienia pay-per-crawl.

Utrzymuj możliwość zbierania danych na oba sposoby. Ścieżka zidentyfikowana (podpisz, zadeklaruj, uzyskaj dostęp lub płać) oraz ścieżka niezidentyfikowana (ocena na podstawie zachowania, jak dotychczas) będą współistnieć przez lata. Budowanie systemów przy założeniu, że istnieje tylko jedna z nich, to kosztowny błąd w obu przypadkach.

Kategorie zostaną zdefiniowane na nowo

Prognoza, za którą bierzemy pełną odpowiedzialność: czwarta kategoria pojawi się w ciągu roku.

Pierwszą wersję każdej taksonomii pisze ten, kto akurat jest pod presją, a klasyfikowani nie siedzą wtedy przy stole. Kategorie Search, Agent i Training opisują to, co firmy AI robią wydawcom. Nie opisują agencji badania rynku, zespołu compliance ani sklepu sprawdzającego ceny u konkurencji, a te trzy podmioty pobierały publiczne strony zgodnie z zasadami na długo zanim słowo „agent” zyskało jakiekolwiek znaczenie w tym kontekście.

Spór o to, jak nazwać to czwarte pole i kto będzie mógł je zaznaczyć, będzie miał dla branży danych większe znaczenie niż jakikolwiek benchmark wykrywania botów opublikowany w tym roku. O to warto powalczyć.

Bo wariant domyślny jest dość prosty. Jeśli twój ruch sam się nie zdefiniuje, ktoś inny zrobi to za ciebie.