Serwisy zastawiają pułapki na crawlery AI
Narzędzie o nazwie Nepenthes zyskało ogromną popularność na początku 2025 roku. Generuje nieskończone labirynty fałszywych stron, z których każda linkuje do kolejnych fałszywych podstron, zamykając crawlery w pętli bez wyjścia. Treść na tych stronach? Algorytmicznie generowany bełkot, zaprojektowany tak, aby zanieczyszczać zbiory danych treningowych AI bezużytecznymi danymi.
Nepenthes nie jest odosobnionym przypadkiem. Projekty takie jak Locaine oraz rosnąca liczba otwartoźródłowych rozwiązań typu "tarpit" pojawiają się na GitHubie z tym samym przesłaniem: skoro firmy AI nie respektują robots.txt, właściciele witryn odpowiedzą zatruwaniem danych.
Ta motywacja jest zrozumiała. Badanie naukowe opublikowane w serwisie arXiv wykazało, że odsetek renomowanych serwisów blokujących AI wzrósł z 23% we wrześniu 2023 roku do prawie 60% w maju 2025 roku. Analiza BuzzStream pokazała, że 79% czołowych serwisów informacyjnych blokuje obecnie boty trenujące AI za pomocą robots.txt. Z kolei Cloudflare Radar poinformował, że 75% ruchu sieciowego powiązanego z AI w połowie 2025 roku generowano na potrzeby trenowania modeli, a nie wyszukiwania czy wnioskowania (inference).
Jednak tarpity nie weryfikują uprawnień. Nie pytają o cel pobierania danych. Zastawiają pułapkę na wszystko, co wygląda na ruch zautomatyzowany.
Kto tak naprawdę wpada w pułapkę
Główne cele są oczywiste: GPTBot, ClaudeBot oraz crawlery firm AI przeszukujące otwarty internet w celu pozyskania danych treningowych. Problem polega na tym, że tarpity nie odróżniają crawlera OpenAI od Twojego skryptu do monitorowania cen.
Tarpity wykrywają wzorce zautomatyzowanych zapytań. Jeśli Twój scraper systematycznie podąża za linkami, odpytuje strony w równych odstępach czasu lub pomija wykonywanie JavaScriptu (dokładnie tak, jak działa większość crawlerów trenujących AI), staje się celem. Pułapki nie obchodzi, że jesteś dziesięcioosobowym zespołem e-commerce śledzącym ceny konkurencji. Widzi ruch o charakterystyce bota i zaczyna serwować fałszywe strony.
To nie jest tylko teoria. Badania przeprowadzone przez Rutgers i Wharton wykazały, że witryny blokujące crawlery AI odnotowały spadek całkowitego ruchu o 23,1% oraz spadek ruchu generowanego przez ludzi o 13,9%. Agresywna polityka blokowania nie tylko zatrzymuje scrapery AI. Uderza również w widoczność samego serwisu.
Tarpity idą jeszcze dalej: aktywnie marnują moc obliczeniową, przestrzeń dyskową i przepustowość crawlera, dostarczając mu dane, które obniżają jakość budowanego modelu lub bazy danych.
Drabina eskalacji
Plik robots.txt zawsze opierał się na umowie dżentelmeńskiej. Działał, dopóki wszyscy przestrzegali zasad. Gdy czołowe firmy AI zaczęły go ignorować (lub stosować kreatywne interpretacje pojęć "crawling na potrzeby wyszukiwania" a "crawling na potrzeby treningu"), właściciele serwisów przeszli do eskalacji.
Ten schemat wygląda następująco:
- Blokady robots.txt: uprzejma prośba
- Filtrowanie User-Agent: blokowanie znanych sygnatur crawlerów AI
- Detekcja behawioralna: wykrywanie nieznanych crawlerów na podstawie wzorców requestów
- Tarpity: aktywne środki zaradcze, które marnują zasoby i zatruwają dane
Każdy krok wyłapuje więcej zagrożeń. Każdy krok wyłapuje również więcej legalnego ruchu. Przy kroku czwartym cały zautomatyzowany dostęp traktowany jest jako wrogi. W efekcie scraper zbierający publicznie dostępne ceny produktów dla porównywarki wpada w te same pułapki, co GPTBot zbierający dane bez zgody.
Co zespoły danych powinny zrobić teraz
Jeśli prowadzisz zbieranie danych na jakąkolwiek skalę, tarpity zmieniają zasady gry. Kilka kwestii ma teraz większe znaczenie niż dawniej.
Zawsze respektuj robots.txt. Brzmi to banalnie, ale to dziś absolutny fundament. Witryny używają robots.txt jako wstępnego filtra. Zignoruj go, a trafisz do tej samej kategorii co boty trenujące AI, które zapoczątkowały całą tę reakcję w postaci tarpitów.
Nie wyglądaj jak crawler trenujący modele. Crawlery trenujące AI mają przewidywalne sygnatury: podążają za każdym linkiem, pobierają strony masowo, pomijają JavaScript i utrzymują regularne interwały. Jeśli twój scraper robi to samo, detekcja behawioralna go oznaczy. Różnicuj odstępy czasowe. Ładuj tylko to, czego potrzebujesz. Wykonuj JavaScript, gdy strona tego wymaga. Pisaliśmy o przyczynach blokowania scraperów w artykule Why Your Web Scraper Keeps Breaking.
Waliduj przychodzące dane. Tarpity serwują wiarygodnie wyglądające śmieciowe dane. Jeśli nie weryfikujesz odpowiedzi w swoim pipeline, możesz zapisywać tekst wygenerowany łańcuchami Markowa jako prawdziwe opisy produktów. Wbuduj walidację jako kluczowy krok, a nie dodatek.
Zainwestuj w infrastrukturę requestów. Stara strategia (rotacja IP, ponawianie po błędzie) już nie wystarcza. Nowoczesne systemy detekcji botów analizują fingerprinty TLS, zachowanie przeglądarki i wzorce sesji. Inteligentny routing proxy pomaga, ale prawdziwa zmiana to przejście z detekcji na poziomie IP do detekcji behawioralnej. Jeśli scrapujesz strony oparte w dużej mierze na JavaScript, zbieranie danych oparte na przeglądarce staje się coraz częściej jedynym niezawodnym podejściem.
Przepaść w dostępie do danych się pogłębia
Uważamy, że sieć zmierza w kierunku wyraźnego podziału. Po jednej stronie: serwisy, które monetyzują dane poprzez płatne umowy dostępowe, partnerstwa API i licencjonowane crawlowanie. Po drugiej: serwisy, które traktują każdy zautomatyzowany dostęp jako zagrożenie i wdrażają coraz bardziej agresywne środki zaradcze.
Dla zespołów danych oznacza to, że koszty pozyskiwania informacji będą stale rosły. Nie dlatego, że trudniej zbudować technologię, ale dlatego, że środowisko jest bardziej wrogie. Zespoły, które inwestują w odpowiedzialne, przejrzyste praktyki scrapingu, zachowają dostęp. Te, które przypominają boty treningowe, wpadną w pułapki, zostaną zatrute fałszywymi danymi i odcięte od źródeł.
Tarpity nie znikną. Pytanie dla Twojego zespołu nie brzmi, czy się nimi przejmować. Chodzi o to, czy Twoja infrastruktura potrafi odróżnić prawdziwą stronę od pułapki, zanim te dane trafią do bazy danych.