← Всички публикации

Откриването на ботове премина към поведенчески анализ. Повечето скрейпъри не го направиха.

Откриването на ботове премина от блокиране на IP адреси към TLS отпечатъци, сигнали от браузъра и поведенчески анализ. Повечето скрейпинг конфигурации водят грешната битка.

През януари 16 милиона заявки доказаха, че блокирането по IP е мъртво

Скалпинг атака удари голяма платформа за електронна търговия през януари 2026 г. Шестнадесет милиона заявки, разпределени между 3.9 милиона уникални IP адреса. Per-IP rate limiting не успя да я спре. Атаката не успя заради сложен код. Тя успя, защото огромният обем от IP адреси обезсмисли традиционното засичане (SecurityBoulevard, March 2026).

Този инцидент доказа това, което индустрията за засичане на ботове твърди от известно време: репутацията на дадено IP сама по себе си не може да различи хора от ботове. И щом защитниците са преминали към нови методи, скрейпърите също трябва да се адаптират.

Трите слоя, които замениха блокирането по IP

Модерното засичане на ботове работи на три слоя. Само първият включва вашето IP.

Connection fingerprinting. Преди вашата заявка да достигне сървъра, още първият пакет от връзката носи отличителна форма, която идентифицира HTTP библиотеката, правеща заявката. Библиотеката requests на Python, стандартният клиент на Go, fetch на Node.js, всяка оставя различен отпечатък. Системите за засичане на ботове проверяват това, преди да са прочели дори един header. Ако вашият сигнатурен отпечатък не съответства на истински браузър, бивате блокирани още на ниво връзка (Reddit r/programming).

Browser fingerprinting. Сайтовете вече проверяват над 300 сигнала от средата на браузъра. Canvas рендериране, WebGL изход, аудио контекст, инсталирани шрифтове, резолюция на екрана, часова зона, информация за GPU. Вашият User-Agent низ е най-малко интересният сигнал в стека. Cloudflare, Akamai и DataDome събират тези данни пасивно чрез JavaScript тестове, които се изпълняват преди зареждането на страницата.

Поведенчески анализ. Това е най-новият слой и най-трудният за симулиране. Системите за засичане на ботове вече следят движенията на мишката, скоростта на скролване, шаблоните на кликване, ритъма на писане и интервалите между взаимодействията. Реалните хора не движат мишката в идеално прави линии. Те правят паузи, подминават бутони, скролват хаотично. Ботовете не правят нищо от това или правят всичко прекалено перфектно (r/webdev, 2026).

Повечето екипи за скрейпване водят грешната битка

Ето неудобната истина: повечето екипи за скрейпване все още инвестират предимно в IP инфраструктура. По-големи proxy пулове, residential IP адреси, ротиращи шлюзове. Те имат своето място. Репутацията на IP все още има значение като един сигнал сред много други.

Но закупуването на 10 000 residential IP адреса няма да помогне, ако вашият отпечатък на ниво връзка крещи "Python script" или вашият headless браузър издава флагове за автоматизация през navigator.webdriver. Харчите пари за грешния слой.

Разработчик, създал 34 production скрапера, писа за този проблем (Dev|Journal, март 2026): разликата между базовия scraping от уроците и работещото в production се определя от системи за засичане на ботове, които анализират connection fingerprints и движения на мишката, а не DOM селектори. Уроците ви учат да парсвате HTML. Production практиката ви учи как да избегнете засичане.

И положението се влошава. Докладът State of Web Scraping 2026 на Browserless установи, че стандартните headless браузъри се блокират по-често от реалните браузъри, защото системите за бот защита са каталогизирали специфичните разлики във fingerprint между headless и headed инстанции. Разликата не намалява.

Ако вашият скрапер продължава да се чупи и гледате само ротацията на proxy, може би поправяте грешния компонент.

Факторът Cloudflare

Cloudflare заслужава специално внимание, защото се намира и от двете страни на тази промяна.

Тяхната услуга Bot Management изпълнява поведенчески анализ на всяка request заявка, като оценява посетителите по скала от 1 до 99 въз основа на десетки сигнали. Turnstile (невидимият им challenge) динамично променя трудността според това колко автентичен изглежда потребителят (документация на Cloudflare).

В същото време Cloudflare пусна своя собствена AI crawler инфраструктура. Общността забеляза иронията (Reddit r/cybersecurity).

На практика това означава следното: сайтовете, защитени от Cloudflare, са най-трудни за scraping през 2026 г., а приблизително 20% от всички уебсайтове са зад тяхната мрежа. Ако вашата стратегия за scraping не отчита поведенческото засичане, губите една пета от достъпния уеб.

Какво реално работи през 2026 г.

Успешните скрапери споделят три характеристики.

Първо, те съответстват на мрежовия подпис (wire-level signature) на актуален браузър. Байт структурата на връзката трябва точно да отговаря на това, което генерира реална Chrome или Firefox сесия. Никакво фалшифициране на headers не може да коригира несъответстващ connection fingerprint.

Второ, те използват реални (или убедително пресъздадени) браузърни среди. Не headless инстанции с настройки по подразбиране, а реални браузърни инстанции с последователни fingerprints, които съответстват на подавания User-Agent.

Трето, за защитени сайтове те добавят реалистичен поведенчески шум. Случайните закъснения не са достатъчни. Времето между действията трябва да следва реалистични разпределения, а траекториите на мишката се нуждаят от естествени криви и колебания.

Архитектурата се промени. Не става въпрос за повече IP адреси. Въпросът е всяка request заявка да бъде неразличима от реален потребител, ползващ истински браузър.

Надпреварата при детекцията се ускорява

Доставчиците на решения за bot-detection започнаха да споделят данни за заплахи в реално време между своите клиенти. Когато един сайт маркира нов bot pattern, всеки друг сайт в мрежата научава за минути (SecurityBoulevard, март 2026). Това е фундаментална промяна спрямо стария модел, при който защитите на всеки сайт работеха независимо.

Смятаме, че това ще оскъпява все повече самостоятелно изградената инфраструктура за scraping. Всеки нов сигнал за детекция изисква инженерен ресурс за неутрализиране, а цикълът се ускорява. Екипите, които управляват детекцията на ниво инфраструктура (smart proxy routing, browser fingerprinting, съпоставяне на ниво връзка), ще се справят по-добре от тези, които просто добавят нови IP адреси.

Въпросът не е дали ви трябват повече проксита. Въпросът е дали вашите заявки изглеждат автентични още преди да достигнат целевия сървър.