Все статьи

Обнаружение ботов стало поведенческим. Большинство скрейперов остались прежними.

Обнаружение ботов перешло от блокировки по IP к отпечаткам TLS, сигналам браузера и поведенческому анализу. Большинство систем скрейпинга ведут борьбу не на том фронте.

В январе 16 миллионов запросов доказали, что блокировка по IP мертва

Атака скальперов обрушилась на крупную платформу электронной коммерции в январе 2026 года. Шестнадцать миллионов запросов распределились по 3.9 миллионам уникальных IP-адресов. Ограничение частоты запросов (rate limit) для каждого IP не помогло. Атака увенчалась успехом не из-за умного кода. Она удалась, поскольку огромный объем IP-адресов сделал традиционное обнаружение бессмысленным (SecurityBoulevard, март 2026).

Этот инцидент доказал то, о чем индустрия защиты от ботов говорила уже давно: репутация IP сама по себе не может отличить людей от ботов. И если защитники пошли дальше, скрейперам тоже нужно двигаться вперед.

Три уровня, которые заменили блокировку по IP

Современное обнаружение ботов работает на трех уровнях. Только первый из них связан с вашим IP.

Отпечатки подключений (Connection fingerprinting). Еще до того, как ваш request достигает сервера, самый первый пакет вашего соединения несет характерную форму, которая идентифицирует HTTP-библиотеку, делающую запрос. Библиотека requests для Python, стандартный клиент Go, fetch для Node.js, каждый из них создает свой уникальный отпечаток. Системы защиты от ботов проверяют это до того, как прочитают хотя бы один header. Если ваша сигнатура не совпадает с реальным браузером, вы блокируетесь на уровне соединения (Reddit r/programming).

Отпечатки браузера (Browser fingerprinting). Теперь сайты проверяют более 300 сигналов из среды браузера. Рендеринг Canvas, вывод WebGL, аудиоконтекст, установленные шрифты, разрешение экрана, часовой пояс, информация о GPU. Ваша строка User-Agent является наименее интересным сигналом в этом стеке. Cloudflare, Akamai и DataDome собирают их пассивно через JavaScript-вызовы, которые запускаются до загрузки страницы (ScrapingBee, 2026).

Поведенческий анализ. Это новейший уровень, и его сложнее всего подделать. Системы защиты от ботов теперь отслеживают движения мыши, скорость прокрутки, паттерны кликов, ритм набора текста и тайминги между взаимодействиями. Живые люди не двигают мышь по идеально прямым линиям. Они делают паузы, промахиваются мимо кнопок, беспорядочно скроллят. Боты не делают ничего из этого, либо делают все слишком идеально (r/webdev, 2026).

Большинство команд скрейпинга ведут борьбу не на том фронте

Вот неудобная правда: большинство команд скрейпинга все еще инвестируют в основном в IP-инфраструктуру. Большие пулы прокси, резидентные IP, ротируемые шлюзы. Для этого есть свое место. Репутация IP по-прежнему важна как один сигнал из многих.

Но покупка 10000 резидентных IP не поможет, если ваш отпечаток на уровне соединения кричит "скрипт на Python", или ваш headless браузер сливает флаги автоматизации через navigator.webdriver. Вы тратите деньги не на тот уровень.

Разработчик, создавший 34 продакшен-скрейпера, написал об этой проблеме (Dev|Journal, март 2026): разрыв между скрейпингом уровня туториалов и тем, что работает в продакшене, определяется антибот-системами, которые анализируют отпечатки соединений и движения мыши, а не DOM-селекторы. Туториалы учат вас парсить HTML. Продакшен учит выживать при обнаружении.

И ситуация ухудшается. В отчете Browserless State of Web Scraping 2026 обнаружено, что стандартные headless браузеры блокируются чаще, чем реальные браузеры, поскольку антибот-системы каталогизировали специфические различия в отпечатках между headless и обычными экземплярами браузеров. Разрыв не сокращается.

Если ваш скрейпер постоянно ломается, и вы смотрите только на ротацию прокси, возможно, вы чините совершенно не то.

Фактор Cloudflare

Cloudflare заслуживает особого упоминания, потому что они находятся по обе стороны этого сдвига.

Их продукт Bot Management выполняет поведенческий анализ каждого запроса, оценивая посетителей по шкале от 1 до 99 на основе десятков сигналов. Turnstile (их невидимая замена CAPTCHA) динамически корректирует сложность проверки на основе того, насколько человечным выглядит посетитель (Документация Cloudflare).

В то же время Cloudflare запустила собственную ИИ-инфраструктуру для краулинга. Сообщество заметило иронию (Reddit r/cybersecurity).

Что это значит на практике: сайты, защищенные Cloudflare, сложнее всего скрейпить в 2026 году, и примерно 20% всех веб-сайтов находятся за их сетью. Если ваша стратегия скрейпинга не учитывает поведенческое обнаружение, вы потеряли пятую часть доступного веба.

Что на самом деле работает в 2026 году

Успешные скрейперы обладают тремя характеристиками.

Во-первых, они соответствуют сигнатуре современного браузера на сетевом уровне. Фактическая форма соединения на уровне байтов должна совпадать с тем, что выдает текущая сессия Chrome или Firefox. Никакая подмена заголовков не исправит несовпадающий отпечаток соединения.

Во-вторых, они запускают реальные (или убедительно реальные) среды браузера. Не headless экземпляры с настройками по умолчанию. Настоящие экземпляры браузера с согласованными отпечатками, которые соответствуют заявленному User-Agent.

В-третьих, для защищенных сайтов они добавляют человекоподобный поведенческий шум. Рандомизированных задержек недостаточно. Тайминги между действиями должны следовать реалистичным распределениям, а траектории движения мыши должны иметь кривые и колебания, которые выглядят органично.

Архитектура изменилась. Дело не в том, чтобы иметь больше IP. Дело в том, чтобы сделать каждый request неотличимым от реального человека, просматривающего реальный браузер.

Гонка вооружений в обнаружении ускоряется

Поставщики средств защиты от ботов начали обмениваться данными об угрозах (threat intelligence) по всей своей клиентской базе в реальном времени. Когда один сайт помечает новый паттерн бота, каждый другой сайт в сети узнает об этом в течение нескольких минут (SecurityBoulevard, март 2026). Это фундаментальное отличие от старой модели, где защита каждого сайта работала независимо.

Мы считаем, что это означает, что стоимость собственной инфраструктуры скрейпинга будет продолжать расти. Каждый новый сигнал обнаружения требует инженерного времени для противодействия, и этот цикл ускоряется. Команды, которые справляются с обнаружением на уровне инфраструктуры (умная маршрутизация прокси, отпечатки браузера, сопоставление на уровне соединения), превзойдут тех, кто продолжает закидывать проблему IP-адресами.

Вопрос не в том, нужно ли вам больше proxy. Вопрос в том, выглядят ли ваши запросы человечными еще до того, как они достигнут целевого сервера.