В январе 16 миллионов запросов доказали, что блокировка по IP больше не работает
В январе 2026 года крупная платформа электронной коммерции подверглась скальпинг-атаке. Шестнадцать миллионов запросов распределились по 3.9 миллиона уникальных IP-адресов. Ограничение частоты запросов на уровне отдельных IP оказалось бессильным. Атака увенчалась успехом не из-за сложного кода. Она сработала, потому что огромное количество IP сделало классическое обнаружение бессмысленным (SecurityBoulevard, март 2026 года).
Этот инцидент подтвердил то, о чем индустрия защиты от ботов говорит уже давно: одна лишь репутация IP не позволяет отличить человека от бота. И если защитные системы перешли на новые методы, разработчикам скрейперов тоже пора перестраиваться.
Три уровня, заменившие блокировку по IP
Современные системы защиты от ботов работают на трех уровнях. Лишь первый из них связан с вашим IP.
Фингерпринтинг соединения. Еще до того, как ваш request дойдет до сервера, самый первый пакет соединения несет в себе уникальные характеристики, которые определяют используемую HTTP-библиотеку. Библиотека requests в Python, стандартный клиент в Go, fetch в Node.js, каждый инструмент формирует свой уникальный отпечаток. Системы защиты от ботов проверяют его до чтения первого же header. Если ваша сигнатура не совпадает с реальным браузером, блокировка происходит на уровне сетевого соединения (Reddit r/programming).
Фингерпринтинг браузера. Сайты теперь проверяют более 300 сигналов из окружения браузера. Отрисовка Canvas, вывод WebGL, аудиоконтекст, установленные шрифты, разрешение экрана, часовой пояс, данные GPU. Ваш User-Agent, наименее информативный сигнал во всем стеке. Cloudflare, Akamai и DataDome пассивно собирают эти данные через проверки на JavaScript, которые выполняются до загрузки страницы.
Поведенческий анализ. Это самый новый уровень и самый сложный для имитации. Системы защиты от ботов отслеживают движения мыши, скорость прокрутки, паттерны кликов, ритм набора текста и интервалы между действиями. Реальные люди не двигают мышь по идеально прямым линиям. Они делают паузы, промахиваются мимо кнопок, прокручивают страницу неравномерно. Боты этого не делают вовсе или делают слишком идеально (r/webdev, 2026 год).
Большинство команд скрейпинга ведут борьбу не на том фронте
Неприятная правда заключается в следующем: большинство команд скрейпинга до сих пор инвестируют в основном в инфраструктуру IP. Крупные пулы proxy, резидентские IP, ротируемые шлюзы. В этом есть смысл. Репутация IP по-прежнему имеет значение, но лишь как один сигнал из многих.
Однако покупка 10 000 резидентских IP не поможет, если фингерпринт соединения прямо указывает на "скрипт на Python", а ваш headless-браузер выдает признаки автоматизации через navigator.webdriver. Вы тратите бюджет не на тот уровень защиты.
Разработчик, создавший 34 production-скрапера, описал эту проблему (Dev|Journal, март 2026): разрыв между скрапингом из обучающих статей и реальным production определяется системами защиты от ботов, которые анализируют фингерпринты соединений и движения мыши, а не DOM-селекторы. Обучающие материалы учат парсить HTML. Production учит выживать под защитой.
Ситуация только усложняется. В отчете Browserless State of Web Scraping 2026 указано, что стандартные headless-браузеры блокируются чаще обычных браузеров, поскольку системы защиты от ботов каталогизировали конкретные различия в фингерпринтах между headless и headed инстансами. Этот разрыв не уменьшается.
Если ваш скрапер постоянно ломается, а вы настраиваете только ротацию proxy, возможно, вы решаете не ту проблему.
Фактор Cloudflare
Cloudflare заслуживает отдельного упоминания, так как компания находится по обе стороны этого процесса.
Их продукт Bot Management выполняет поведенческий анализ каждого request, оценивая посетителей по шкале от 1 до 99 на основе десятков сигналов. Turnstile (их невидимый challenge) динамически меняет сложность проверки в зависимости от того, насколько поведение посетителя похоже на человека (документация Cloudflare).
В то же время Cloudflare запустила собственную инфраструктуру для AI-краулинга. Сообщество обратило внимание на эту иронию (Reddit r/cybersecurity).
Что это означает на практике: сайты под защитой Cloudflare сложнее всего парсить в 2026 году, при этом около 20% всех веб-сайтов находятся за их сетью. Если ваша стратегия скрапинга не учитывает поведенческий анализ, вы теряете пятую часть доступного веба.
Что действительно работает в 2026 году
Успешные скраперы обладают тремя общими характеристиками.
Во-первых, они воспроизводят сигнатуру актуального браузера на сетевом уровне. Байт-структура соединения должна точно соответствовать тому, что генерирует текущая сессия Chrome или Firefox. Никакая подмена header не спасет при несовпадающем фингерпринте соединения.
Во-вторых, они используют реальные (или неотличимые от реальных) браузерные среды. Не headless-инстансы с настройками по умолчанию, а полноценные инстансы браузера с консистентными фингерпринтами, соответствующими заявленному User-Agent.
В-третьих, для защищенных сайтов они добавляют шум, имитирующий поведение человека. Простых рандомизированных задержек недостаточно. Интервалы между действиями должны подчиняться реалистичным распределениям, а траектории движения мыши должны содержать плавные кривые и естественные паузы.
Архитектурный подход изменился. Дело больше не в количестве IP. Задача в том, чтобы каждый request был неотличим от действий реального пользователя в реальном браузере.
Гонка вооружений в сфере детекции ускоряется
Поставщики решений для защиты от ботов начали обмениваться данными об угрозах между своими клиентами в реальном времени. Когда один сайт фиксирует новый паттерн бота, все остальные сайты в сети узнают об этом за считанные минуты (SecurityBoulevard, март 2026). Это принципиальное отличие от старой модели, где защита каждого ресурса работала изолированно.
По нашей оценке, стоимость собственной инфраструктуры для скрапинга продолжит расти. Каждый новый сигнал детекции требует инженерных ресурсов на адаптацию, и этот цикл ускоряется. Команды, решающие вопросы обхода детекции на уровне инфраструктуры (умная маршрутизация proxy, фингерпринтинг браузера, соответствие параметров на уровне соединений), покажут лучшие результаты, чем те, кто просто заваливает проблему пулом IP.
Вопрос не в том, нужно ли вам больше proxy. Вопрос в том, выглядят ли ваши request как действия человека еще до того, как они достигнут целевого сервера.