Wszystkie wpisy

Search, Agent, Training: nowe reguły dla botów w sieci

Cloudflare dzieli teraz boty według celu, a nie zachowania: Search, Agent lub Training. Domyślne ustawienie z 15 września jest węższe niż wywołana panika i brakuje w nim jednej opcji.

Sieć zaczyna dzielić boty według celu, a nie zachowania

Każdy system anti-bot stworzony w ciągu ostatnich piętnastu lat zadaje jedno pytanie: czy ten ruch wygląda na zautomatyzowany? Kolejność nagłówków, fingerprinty na poziomie sieciowym, ruchy myszą, timing sesji. Wszystko to próbuje wywnioskować coś o kliencie na podstawie kształtu żądania.

1 lipca 2026 roku Cloudflare zmieniło to pytanie. Ruch botów dzieli się teraz na trzy kategorie, które nie mają nic wspólnego z tym, jak request wygląda w sieci. Search obejmuje "cowlery indeksujące treść, aby móc później odpowiadać na pytania na jej temat". Agent obejmuje "zautomatyzowane działania realizowane w czasie rzeczywistym w imieniu użytkownika". Training obejmuje "crawlery pobierające treść w celu trenowania lub dostrajania modeli".

Wyobraź sobie trzy żądania docierające do tego samego serwera. Ten sam klient, te same nagłówki, ten sam timing, identyczne co do bajta. W tym modelu mogą otrzymać trzy różne werdykty, zależne wyłącznie od tego, co zamierzasz zrobić ze stroną po jej pobraniu.

To nie jest lepszy detektor. To zupełnie inny prymityw.

Termin 15 września ma węższy zakres niż panika

Wersja tej historii krążąca po forach programistycznych mówi, że 15 września Cloudflare zablokuje agentów AI w jednej piątej internetu.

Changelog mówi o czymś znacznie mniejszym. Nowe ustawienia domyślne dotyczą "nowych domen dołączających do Cloudflare". Na tych domenach "boty sklasyfikowane jako Training lub Agent są blokowane na stronach wyświetlających reklamy, podczas gdy Search pozostaje dozwolony". Wszyscy obecni użytkownicy Cloudflare wybierają własne ustawienia i mogą to zrobić w dowolnym momencie przed tą datą.

Podsumowując: tylko nowe domeny, tylko strony z reklamami, a jedna z trzech kategorii nadal przechodzi domyślnie. To realna zmiana, ale nie jest to mur postawiony w całym internecie.

Ciekawy jest jednak ten wąski zakres. Cloudflare nie opublikowało nowej polityki, opublikowało ustawienie domyślne, a ustawienia domyślne to sposób, w jaki zasada staje się normą bez żadnego głosowania. Liczbą wartą obserwowania nie jest 15 września. Jest nią to, ile z tych domen nigdy później nie zmieni tego ustawienia.

Co to oznacza: jeśli zbierasz dane, użytecznym pytaniem przestało być "czy przejdę przez zabezpieczenia tej witryny", a stało się "w jakiej kategorii widzi mnie ta witryna". Mają one różne odpowiedzi i tylko jedną z nich da się przetestować.

Celu nie da się zmierzyć. Trzeba go zadeklarować.

Oto mechaniczny problem z klasyfikacją ruchu według intencji: intencji nie ma w pakiecie.

Fingerprint mozna zmierzyc. Ruchy myszy mozna zmierzyc. Pytania "dlaczego pobierasz te strone" zmierzyc sie nie da, wiec system wymaga, aby klient zadeklarowal to wprost, i potrzebuje powodu, by tej odpowiedzi zaufac. Na tym polega zadanie Web Bot Auth. Agent podpisuje swoje requesty kluczem prywatnym, publikuje katalog kluczy, a wezel edge weryfikuje podpis na jego podstawie, w oparciu o RFC 9421 HTTP Message Signatures. Dokumentacja Cloudflare definiuje prog dla zweryfikowanego bota jako "uczciwa samoidentyfikacje".

Przyjrzyjmy sie teraz temu, co wymusza to na duza skale. Specyfikacja to draft-meunier-webbotauth-httpsig-protocol-02, ostatnio zmieniona 18 sierpnia 2026 r. Docelowy status: Standards Track. Rzeczywisty status: "Active Internet-Draft (individual)", ktory "nie jest popierany przez IETF" i nie ma "zadnego formalnego statusu w procesie standaryzacji IETF". Ma dwoch autorow. Jeden pracuje w Cloudflare, drugi w Google.

Uwazamy, ze sam projekt jest trafny, i warto to podkreslic przed przejsciem do krytyki. Podpisana tozsamosc jest lepsza niz wyscig zbrojen na rynku CAPTCHA dla kazdego, kto zamierza dzialac uczciwie. Crawler, ktory sam sie identyfikuje, moze byc celowo dopuszczony, ograniczony przez rate limit lub rozliczany, zamiast byc przedmiotem domyslow, a wlasciciele witryn zyskuja kontrole, ktora nie uderza rykoszetem w prawdziwych uzytkownikow. Warto zestawic to z dekada blokowania zakresow IP i liczenia na szczescie.

To rozwiazanie nie potrafi jednak nikogo zatrzymac. System oparty na deklarowanym celu sortuje tylko ruch, ktory sam sie deklaruje. Cala reszta trafia do istniejacego juz stosu detekcji, a ten staje sie coraz bardziej precyzyjny: punktacja behawioralna na poziomie sesji od Cloudflare pojawila sie dwanascie dni po wprowadzeniu nowych kategorii.

Oba podejscia wiec ze soba nie rywalizuja. Tozsamosc segreguje uczciwych, detekcja zajmuje sie reszta, a do tej drugiej grupy Twoj ruch trafia domyslnie, jesli niczego nie zadeklarujesz.

Brak kategorii dla zbierania danych publicznych

A teraz czesc, ktora powinna zaniepokoic kazdego, kto zarzadza pipeline'em do zbierania danych.

Sprawdz projekty opublikowane przez nas w tym roku. Indeks cen drewna zbudowany z publicznych ogloszen. Wykrywanie naruszen MAP na szesciu platformach marketplace, co oznacza pobieranie tej samej strony produktu z szesciu roznych lokalizacji i porownywanie wynikow. Rankingi w app store i analiza sentymentu opinii. Weryfikacja emisji reklam prowadzona z kraju, w ktorym kampania zostala faktycznie wykupiona.

Przypisz te zadania do kategorii Search, Agent lub Training.

Search nie pasuje: własna definicja Cloudflare zakłada oczekiwanie na "ruch odsyłający lub inne sprawiedliwe wynagrodzenie w zamian", a nocne sprawdzanie cen nie odsyła nikogo. Agent również nie pasuje, ponieważ żaden człowiek nie siedzi przed ekranem, czekając na to pobranie. Z kolei Training jest po prostu błędny, ponieważ nic nie trafia do modelu.

To taksonomia stworzona do opisania ruchu AI, który pojawił się w ciągu ostatnich trzech lat, a teraz została zastosowana do branży istniejącej dekadę wcześniej. Price intelligence, alternative data, SERP tracking, ochrona marki, weryfikacja reklam, monitorowanie zgodności: nic z tego nie jest nowe, nic z tego nie jest agencyjne i dla żadnego z nich nie ma odpowiedniej opcji do zaznaczenia.

Ruch bez przypisanej kategorii jest szufladkowany przez tego, kto te kategorie stworzył. Zwykle do najbliższej możliwej.

Co to oznacza dla zespołów danych

Cztery rzeczy, które warto zrobić, dopóki zasady są jeszcze elastyczne.

Zdecyduj, do której kategorii szczerze należysz. Nie do tej, która pozwala przejść przez zabezpieczenia. Do tej, którą obronisz na piśmie, jeśli wydawca zapyta wprost. Jeśli szczera odpowiedź brzmi "żadna z nich", jesteś w grupie, która straci najwięcej, gdy taksonomia okrzepnie, i zyska najwięcej, mówiąc o tym głośno, dopóki trwa dyskusja.

Sprawdzaj ustawienia celu, a nie nagłówki. Polityka dotycząca botów jest teraz właściwością konkretnego serwisu, konfigurowalną dla poszczególnych ścieżek, i zmienia się bez powiadomienia. Traktowanie hasła "Cloudflare blokuje agentów we wrześniu" jako faktu dotyczącego Twojego pipeline'u skończy się przebudowywaniem elementów, które nigdy nie były zagrożone.

Załóż, że test stron z reklamami się rozprzestrzeni. Cloudflare powiązało swoje domyślne reguły ze stronami wyświetlającymi reklamy, co jest niezłym wyznacznikiem zasady: "ta strona zarabia na uwadze człowieka". Ta granica się przesunie, a Cloudflare nie jest jedynym podmiotem, który ją wyznacza. AWS WAF wdrożył monetyzację ruchu AI 15 czerwca 2026 roku, odpowiadając kodem 402 i maszynowo czytelnymi warunkami płatności. Akamai wybrało ścieżkę partnerską z TollBit i Skyfire. Trzej najwięksi dostawcy edge sprzedają teraz tę samą płaszczyznę kontroli, której przyglądaliśmy się od strony cenników, gdy ruszył model pay-per-crawl.

Utrzymuj scraping w gotowości do działania na obu torach. Tor zidentyfikowany (podpisz, zadeklaruj, uzyskaj dostęp lub płać) oraz niezidentyfikowany (ocena na podstawie zachowania, jak dotychczas) będą współistnieć przez lata. Projektowanie systemów z założeniem, że istnieje tylko jeden z nich, to kosztowny błąd w obu przypadkach.

Kategorie zostaną zdefiniowane na nowo

Prognoza, z której chętnie damy się rozliczyć: czwarta kategoria pojawi się w ciągu roku.

Pierwszą wersję każdej taksonomii pisze ten, kto akurat jest pod presją, a klasyfikowani nie siedzą wtedy przy stole. Wyszukiwanie, agent i trenowanie opisują to, co firmy AI robią wydawcom. Nie opisują firmy badającej rynek, zespołu ds. zgodności ani sprzedawcy sprawdzającego ceny u konkurencji, a te trzy podmioty pobierały publiczne strony zgodnie z zasadami na długo przed tym, zanim słowo „agent” zyskało jakiekolwiek znaczenie w tym kontekście.

Walka o to, jak nazwać to czwarte pole wyboru i kto będzie mógł je zaznaczyć, będzie miała większe znaczenie dla branży danych niż jakikolwiek benchmark systemów anti-bot opublikowany w tym roku. O to warto powalczyć.

Alternatywa jest bowiem prosta. Jeśli twój ruch sieciowy sam się nie zdefiniuje, ktoś inny zrobi to za ciebie.