Сайтовете залагат капани за AI ботове
Инструмент на име Nepenthes придоби огромна популярност в началото на 2025 г. Той генерира безкрайни лабиринти от фалшиви уеб страници, всяка от които води към още фалшиви страници, проектирани да заключат ботовете в капан без изход. Текстът на тези страници? Алгоритмично генерирани безсмислици, създадени да замърсят с боклук масивите от данни за обучение на AI.
Nepenthes не е единствен. Проекти като Locaine и растящ списък от open-source "tarpits" (капани за забавяне) се появиха в GitHub, всички с една и съща идея: ако AI компаниите не зачитат robots.txt, собствениците на сайтове ще отвърнат с отрова.
Мотивацията е ясна. Академично изследване в arXiv установи, че блокирането на AI сред реномираните сайтове е скочило от 23% през септември 2023 г. до близо 60% към май 2025 г. Анализ на BuzzStream показа, че 79% от водещите новинарски сайтове вече блокират ботовете за AI обучение чрез robots.txt. А Cloudflare Radar отчете, че 75% от AI уеб трафика в средата на 2025 г. е бил генериран за целите на обучение, а не за търсене или извеждане на резултати (inference).
Но капаните не проверяват идентификационни данни. Те не питат защо събирате данни. Те залавят всичко, което изглежда автоматизирано.
Кой всъщност попада в капана
Предвидените цели са ясни: GPTBot, ClaudeBot, ботовете на AI компаниите, които събират отворения уеб за данни за обучение. Проблемът е, че капаните не могат да различат бота на OpenAI от вашия скрипт за мониторинг на цени.
Капаните засичат автоматизирани модели на заявки. Ако вашият скрапер следва връзки систематично, посещава страници на равни интервали или пропуска изпълнението на JavaScript (както работят повечето ботове за AI обучение), той изглежда като мишена. Капанът не се интересува, че сте екип от 10 души в e-commerce, следящ цените на конкурентите. Той вижда бот трафик и започва да сервира фалшиви страници.
Това не е просто теория. Изследване от Rutgers и Wharton установи, че сайтовете, блокиращи AI ботове, регистрират 23.1% спад в общия трафик и 13.9% спад в трафика от реални потребители. Агресивната позиция на блокиране не просто спира AI скраперите. Тя вреди и на видимостта на самия сайт.
А капаните стигат още по-далеч: те активно хабят изчислителна мощ, дисково пространство и честотна лента на бота, докато му подават данни, които влошават качеството на модела или базата данни, която изграждате.
Ескалацията
Robots.txt винаги е бил джентълменско споразумение. Той работеше, когато всички спазваха правилата. Когато големите AI компании започнаха да го игнорират (или да намират креативни тълкувания за "събиране за търсене" спрямо "събиране за обучение"), собствениците на сайтове ескалираха мерките.
Моделът изглежда така:
- Robots.txt блокирания: учтивото искане
- User-Agent филтриране: блокиране на познати сигнатури на AI crawler-и
- Поведенческо засичане: хващане на непознати crawler-и по техните модели на заявки
- Tarpits: активни контрамерки, които хабят ресурси и отравят данни
Всяка стъпка улавя повече заплахи. Всяка стъпка също така улавя повече легитимен трафик. До стъпка четири вече третирате целия автоматизиран достъп като враждебен. Така scraper, събиращ публично достъпни цени на продукти за услуга за сравнение, попада в същите капани като GPTBot, събиращ данни без разрешение.
Какво трябва да направят екипите за данни сега
Ако извършвате събиране на данни в какъвто и да е мащаб, tarpits променят правилата. Няколко неща имат по-голямо значение от преди.
Уважавайте robots.txt, винаги. Това звучи базово, но вече е абсолютен минимум. Сайтовете използват robots.txt като първи филтър. Пренебрегнете го и се поставяте в същата категория като AI ботовете за обучение, които предизвикаха целия този tarpit отговор.
Не изглеждайте като crawler за обучение. Crawler-ите за AI обучение имат предвидими сигнатури: те следват всяка връзка, изискват страници на едро, пропускат JavaScript и поддържат регулярни интервали. Ако вашият scraper прави същото, поведенческото засичане ще го маркира. Варирайте тайминга си. Зареждайте само това, от което се нуждаете. Изпълнявайте JavaScript, когато сайтът го изисква. Писахме за причините за блокиране на scrapers в Защо вашият web scraper продължава да се чупи.
Валидирайте входящите данни. Tarpits сервират правдоподобно изглеждащ боклук. Ако не проверявате отговорите във вашия pipeline, може да записвате генериран от Марков текст като реални описания на продукти. Изградете валидацията като основна стъпка, а не като закъсняла идея.
Инвестирайте във вашата инфраструктура за заявки. Старият подход (ротация на IP адреси, повторен опит при грешка) вече не е достатъчен. Съвременните системи за засичане на ботове анализират TLS отпечатъци, поведение на браузъра и сесийни модели. Интелигентното proxy маршрутизиране помага, но истинската промяна е преходът от засичане на ниво IP към засичане на ниво поведение. Ако събирате данни от сайтове с тежък JavaScript, събирането чрез браузър става все по-често единственият надежден подход.
Пропастта в достъпа се задълбочава
Смятаме, че мрежата върви към ясно разделение. От едната страна: сайтове, които монетизират данни чрез споразумения за платен достъп, API партньорства и лицензиран crawling. От другата страна: сайтове, които третират целия автоматизиран достъп като заплаха и внедряват все по-агресивни контрамерки.
За екипите за данни това означава, че разходите за събиране ще продължат да растат. Не защото технологията е по-трудна за изграждане, а защото средата е по-враждебна. Екипите, които инвестират в отговорни, прозрачни практики за scraping, ще запазят достъпа си. Тези, които изглеждат като ботове за обучение, ще бъдат хванати в капан, отровени и блокирани.
Tarpit капаните няма да изчезнат. Въпросът пред екипа ви не е дали да се притеснява за тях. Въпросът е дали вашата инфраструктура може да различи истинска страница от капан, преди тези данни да стигнат до базата ви от данни.