Сайты расставляют ловушки для AI-краулеров
Инструмент Nepenthes привлек широкое внимание в начале 2025 года. Он генерирует бесконечные лабиринты поддельных веб-страниц, ссылающихся друг на друга, чтобы запереть краулеры в бесконечном цикле. Текст на этих страницах представляет собой алгоритмически сгенерированную бессмыслицу, созданную для засорения обучающих датасетов AI мусорными данными.
Nepenthes не одинок. Проекты вроде Locaine и растущий список открытых tarpit-решений появились на GitHub с одинаковой целью: если AI-компании не уважают robots.txt, владельцы сайтов будут защищаться ядовитыми данными.
Причины понятны. Академическое исследование на arXiv показало, что доля авторитетных сайтов, блокирующих AI, выросла с 23% в сентябре 2023 года до почти 60% к маю 2025 года. Анализ BuzzStream показал, что 79% ведущих новостных сайтов сейчас блокируют ботов для обучения AI через robots.txt. А Cloudflare Radar сообщил, что 75% веб-трафика, связанного с AI в середине 2025 года, генерировалось для обучения моделей, а не для поиска или инференса.
Но tarpit-ловушки не проверяют учетные данные. Они не спрашивают цель краулинга. Они ловят все, что выглядит автоматизированным.
Кто попадает в ловушки на самом деле
Предполагаемые цели очевидны: GPTBot, ClaudeBot и другие краулеры AI-компаний, собирающие открытый веб для обучающих данных. Проблема в том, что tarpit не отличает краулер OpenAI от вашего скрипта мониторинга цен.
Tarpit-системы распознают паттерны автоматизированных запросов. Если ваш скрапер систематически переходит по ссылкам, запрашивает страницы с одинаковыми интервалами или пропускает выполнение JavaScript (как это делает большинство краулеров для обучения AI), он становится мишенью. Ловушке все равно, что вы команда из 10 человек, отслеживающая цены конкурентов в e-commerce. Она видит трафик, похожий на бота, и начинает отдавать поддельные страницы.
Это не просто теория. Исследование Ратгерского университета и школы Уортон показало, что сайты, блокирующие AI-краулеры, столкнулись со снижением общего трафика на 23.1% и падением человеческого трафика на 13.9%. Агрессивная блокировка не просто останавливает AI-скраперы. Она также снижает видимость самого сайта.
При этом tarpit-системы идут дальше: они намеренно расходуют вычислительные ресурсы, хранилище и пропускную способность краулера, одновременно снабжая его данными, которые ухудшают создаваемую модель или базу данных.
Лестница эскалации
Файл robots.txt всегда был джентльменским соглашением. Он работал, пока все соблюдали правила. Когда крупные AI-компании начали игнорировать его (или находить творческие трактовки для разницы между «краулингом для поиска» и «краулингом для обучения»), владельцы сайтов перешли к более жестким мерам.
Эта схема выглядит следующим образом:
- Блокировки через robots.txt: вежливая просьба
- Фильтрация по User-Agent: блокировка известных сигнатур AI-краулеров
- Поведенческий анализ: обнаружение неизвестных краулеров по паттернам их запросов
- Тарпиты (tarpits): активные контрмеры, которые расходуют ресурсы и отравляют данные
Каждый шаг отсекает больше угроз. Но каждый шаг также затрагивает больше легитимного трафика. К четвертому шагу вы начинаете относиться ко всему автоматизированному доступу как к враждебному. В итоге скрейпер, собирающий общедоступные цены на товары для сервиса сравнения, попадает в те же ловушки, что и GPTBot, собирающий данные без разрешения.
Что теперь делать командам работы с данными
Если вы собираете данные в сколь-либо значительных масштабах, тарпиты меняют правила игры. Несколько моментов становятся важнее, чем раньше.
Всегда соблюдайте robots.txt. Это звучит банально, но сейчас это базовое требование. Сайты используют robots.txt как фильтр первого уровня. Игнорируя его, вы ставите себя в один ряд с ботами для обучения AI, из-за которых и началась вся эта волна защитных мер.
Не будьте похожи на краулер для обучения моделей. У обучающих AI-краулеров предсказуемые паттерны: они переходят по каждой ссылке, запрашивают страницы массово, пропускают JavaScript и работают с фиксированными интервалами. Если ваш скрейпер ведет себя так же, поведенческий анализ сразу его заметит. Варьируйте задержки. Загружайте только то, что необходимо. Выполняйте JavaScript, если сайт этого требует. Мы подробно разбирали причины блокировок в статье Why Your Web Scraper Keeps Breaking.
Валидируйте входящие данные. Тарпиты отдают правдоподобный мусор. Если вы не проверяете ответы внутри своего пайплайна, вы рискуете сохранить текст, сгенерированный цепями Маркова, под видом реальных описаний товаров. Сделайте валидацию базовым этапом, а не запоздалой доработкой.
Инвестируйте в инфраструктуру запросов. Старого подхода (ротация IP, повтор при ошибке) уже недостаточно. Современные системы обнаружения ботов анализируют отпечатки TLS, поведение браузера и сессионные паттерны. Smart proxy routing помогает, но главный сдвиг произошел в переходе от детекции по IP к поведенческому анализу. Если вы собираете данные с сайтов с обилием JavaScript, browser-based collection все чаще становится единственным надежным вариантом.
Разрыв в доступе растет
Мы считаем, что веб идет к явному разделению. С одной стороны, сайты, которые монетизируют данные через платные соглашения о доступе, партнерские API и лицензированный сбор данных. С другой стороны, сайты, которые рассматривают любой автоматизированный доступ как угрозу и внедряют все более агрессивные контрмеры.
Для команд работы с данными это означает, что затраты на сбор продолжат расти. Не потому, что технологии сложнее создавать, а потому, что среда стала более агрессивной. Команды, которые инвестируют в ответственные и прозрачные методы скрейпинга, сохранят доступ. Те, кто выглядит как боты для обучения моделей, попадут в ловушки, получат отравленные данные и будут заблокированы.
Тарпиты никуда не исчезнут. Вопрос для вашей команды заключается не в том, стоит ли о них беспокоиться. Вопрос в том, сможет ли ваша инфраструктура отличить реальную страницу от ловушки до того, как эти данные попадут в вашу базу данных.