← Wszystkie wpisy

Detekcja botów przeszła na analizę behawioralną. Większość scraperów nie.

Detekcja botów przeszła od blokowania IP do fingerprintów TLS, sygnałów z przeglądarki i analizy behawioralnej. Większość architektur do scrapingu toczy niewłaściwą bitwę.

W styczniu 16 milionów requestów udowodniło, że blokowanie IP jest martwe

W styczniu 2026 roku atak typu scalping uderzył w dużą platformę e-commerce. Szesnaście milionów requestów rozproszonych na 3,9 miliona unikalnych adresów IP. Rate limiting oparty na pojedynczych IP nie miał szans. Atak nie powiódł się dzięki sprytnemu kodowi. Udał się, ponieważ sama liczba adresów IP sprawiła, że tradycyjna detekcja stała się bezużyteczna (SecurityBoulevard, marzec 2026).

Ten incydent udowodnił to, o czym branża detekcji botów mówi od pewnego czasu: sama reputacja IP nie odróżni człowieka od bota. A skoro systemy obronne poszły do przodu, zespoły scrapingowe również muszą to zrobić.

Trzy warstwy, które zastąpiły blokowanie IP

Współczesna detekcja botów działa na trzech warstwach. Tylko pierwsza z nich dotyczy Twojego IP.

Fingerprinting połączenia. Zanim Twój request dotrze do serwera, pierwszy pakiet połączenia niesie charakterystyczny profil, który identyfikuje bibliotekę HTTP wykonującą zapytanie. Biblioteka requests w Pythonie, domyślny klient w Go, fetch w Node.js, każdy generuje unikalny fingerprint. Systemy detekcji botów sprawdzają to, zanim odczytają choćby jeden header. Jeśli Twoja sygnatura nie pasuje do prawdziwej przeglądarki, blokada następuje na poziomie połączenia (Reddit r/programming).

Fingerprinting przeglądarki. Witryny weryfikują obecnie ponad 300 sygnałów ze środowiska przeglądarki. Renderowanie Canvas, wyjście WebGL, kontekst audio, zainstalowane fonty, rozdzielczość ekranu, strefę czasową, informacje o GPU. Twój string User-Agent jest najmniej interesującym sygnałem w całym stosie. Cloudflare, Akamai i DataDome zbierają te dane pasywnie za pomocą zadań JavaScript, które uruchamiają się przed załadowaniem strony.

Analiza behawioralna. To najnowsza warstwa i najtrudniejsza do podrobienia. Systemy detekcji botów śledzą obecnie ruchy myszy, prędkość przewijania, wzorce kliknięć, rytm pisania na klawiaturze oraz odstępy czasowe między interakcjami. Prawdziwi ludzie nie poruszają myszą po idealnie prostych liniach. Robią pauzy, mijają przyciski, przewijają stronę w nieregularny sposób. Boty nie robią nic z tego albo robią wszystko zbyt idealnie (r/webdev, 2026).

Większość zespołów scrapingowych toczy niewłaściwą walkę

Oto niewygodna prawda: większość zespołów scrapingowych nadal inwestuje głównie w infrastrukturę IP. Większe pule proxy, residential IP, rotujące bramki. Jest na to miejsce. Reputacja IP nadal ma znaczenie jako jeden z wielu sygnałów.

Jednak zakup 10 000 residential IP nic nie da, jeśli Twój fingerprint na poziomie połączenia jednoznacznie wskazuje na skrypt Pythona, a Twoja przeglądarka headless zdradza automatyzację przez navigator.webdriver. Wydajesz budżet na niewłaściwą warstwę.

Programista, który zbudował 34 scrapery produkcyjne, opisał ten problem (Dev|Journal, marzec 2026): różnicę między prostym scrapingiem z samouczków a rozwiązaniami działającymi na produkcji wyznaczają systemy wykrywania botów, które analizują fingerprinty połączeń i ruchy kursora, a nie selektory DOM. Samouczki uczą parsowania HTML. Produkcja uczy unikania wykrycia.

Sytuacja staje się coraz trudniejsza. Z raportu Browserless State of Web Scraping 2026 wynika, że standardowe przeglądarki headless są flagowane częściej niż prawdziwe przeglądarki, ponieważ systemy wykrywania botów skatalogowały konkretne różnice w fingerprintach między instancjami headless a headed. Ta przepaść wcale się nie zmniejsza.

Jeśli Twój scraper ciągle przestaje działać, a Ty skupiasz się wyłącznie na rotacji proxy, być może naprawiasz zupełnie niewłaściwy element.

Czynnik Cloudflare

Cloudflare zasługuje na szczególne wyróżnienie, ponieważ znajduje się po obu stronach tej zmiany.

Ich produkt Bot Management przeprowadza analizę behawioralną każdego żądania, oceniając odwiedzających w skali 1-99 na podstawie kilkudziesięciu sygnałów. Turnstile (ich niewidoczne wyzwanie) dynamicznie dostosowuje poziom trudności weryfikacji w zależności od tego, jak bardzo zachowanie odwiedzającego przypomina człowieka (dokumentacja Cloudflare).

Jednocześnie Cloudflare uruchomiło własną infrastrukturę do crawlingu dla AI. Społeczność szybko zauważyła tę ironię (Reddit r/cybersecurity).

Co to oznacza w praktyce: strony chronione przez Cloudflare są najtrudniejsze do scrapowania w 2026 roku, a około 20% wszystkich serwisów internetowych działa za ich siecią. Jeśli Twoja strategia scrapingu nie uwzględnia detekcji behawioralnej, tracisz dostęp do jednej piątej sieci.

Co faktycznie działa w 2026 roku

Skuteczne scrapery mają trzy wspólne cechy.

Po pierwsze, dokładnie odwzorowują sygnaturę sieciową na poziomie transmisji aktualnej przeglądarki. Rzeczywisty, bajtowy profil połączenia musi odpowiadać temu, co generuje bieżąca sesja Chrome lub Firefox. Żadne fałszowanie nagłówków nie naprawi niedopasowanego fingerprintu połączenia.

Po drugie, uruchamiają one prawdziwe (lub przekonująco wierne) środowiska przeglądarek. Nie domyślne instancje headless. Rzeczywiste instancje przeglądarek ze spójnymi fingerprintami odpowiadającymi deklarowanemu nagłówkowi User-Agent.

Po trzecie, w przypadku chronionych stron wprowadzają one szum behawioralny imitujący zachowanie człowieka. Losowe opóźnienia już nie wystarczą. Odstępy czasowe między akcjami muszą opierać się na realistycznych rozkładach, a trajektorie ruchu myszy wymagają naturalnych krzywizn i zawahań.

Architektura uległa więc zmianie. Nie chodzi już o posiadanie większej liczby adresów IP. Chodzi o to, aby każde żądanie było nie do odróżnienia od działań prawdziwego użytkownika korzystającego z prawdziwej przeglądarki.

Wyścig zbrojeń w detekcji botów przyspiesza

Dostawcy rozwiązań bot-detection zaczęli udostępniać dane o zagrożeniach w czasie rzeczywistym w ramach całej swojej bazy klientów. Gdy jedna witryna oznaczy nowy wzorzec bota, każda inna strona w sieci dowiaduje się o tym w ciągu kilku minut (SecurityBoulevard, marzec 2026). To fundamentalna zmiana w porównaniu ze starym modelem, w którym zabezpieczenia każdej witryny działały niezależnie.

Oznacza to, że koszt utrzymania własnej infrastruktury do scrapingu będzie stale rósł. Każdy nowy sygnał detekcji wymaga czasu inżynierów, aby go zneutralizować, a ten cykl stale przyspiesza. Zespoły, które radzą sobie z detekcją na poziomie infrastruktury (inteligentny routing proxy, fingerprinting przeglądarki, dopasowywanie na poziomie połączenia), poradzą sobie znacznie lepiej niż te, które po prostu zarzucają problem kolejnymi adresami IP.

Pytanie nie brzmi, czy potrzebujesz więcej proxy. Chodzi o to, czy Twoje requesty wyglądają jak ruch od człowieka, zanim w ogóle dotrą do docelowego serwera.