Всички публикации

Откриването на ботове премина към поведенчески анализ. Повечето скрейпъри не го направиха.

Откриването на ботове премина от блокиране на IP адреси към TLS отпечатъци, сигнали от браузъра и поведенчески анализ. Повечето скрейпинг конфигурации водят грешната битка.

През януари 16 милиона заявки доказаха, че блокирането по IP е мъртво

Скалпинг атака удари голяма платформа за електронна търговия през януари 2026 г. Шестнадесет милиона заявки бяха разпределени в 3.9 милиона уникални IP адреса. Ограничаването на скоростта (rate limit) за IP не успя да я спре. Атаката не успя заради умен код. Тя успя, защото огромният обем от IP адреси обезсмисли традиционното откриване (SecurityBoulevard, март 2026 г.).

Този инцидент доказа това, което анти-бот индустрията повтаря от известно време: репутацията на IP адреса сама по себе си не може да различи хората от ботовете. И ако защитниците са продължили напред, скрейпърите също трябва да го направят.

Трите слоя, които замениха блокирането по IP

Съвременното откриване на ботове работи на три слоя. Само първият от тях включва вашето IP.

Отпечатъци на връзката. Преди вашата заявка да достигне сървъра, първият пакет на връзката ви носи отличителна форма, която идентифицира HTTP библиотеката, правеща заявката. Библиотеката requests на Python, клиентът по подразбиране на Go, fetch на Node.js, всеки от тях създава различен отпечатък. Анти-бот системите проверяват това, преди да прочетат дори един header. Ако вашият подпис не съвпада с реален браузър, вие сте блокирани на ниво връзка (Reddit r/programming).

Отпечатъци на браузъра. Сайтовете вече проверяват над 300 сигнала от средата на браузъра. Рендериране на Canvas, изход от WebGL, аудио контекст, инсталирани шрифтове, разделителна способност на екрана, часова зона, информация за GPU. Вашият низ за User-Agent е най-малко интересният сигнал в стека. Cloudflare, Akamai и DataDome събират тези данни пасивно чрез JavaScript проверки, които се изпълняват преди зареждането на страницата (ScrapingBee, 2026 г.).

Поведенчески анализ. Това е най-новият слой и най-трудният за фалшифициране. Анти-бот системите вече проследяват движенията на мишката, скоростта на скролиране, моделите на кликване, ритъма на писане и времето между взаимодействията. Реалните хора не движат мишката в идеално прави линии. Те спират, подминават бутоните, скролират хаотично. Ботовете не правят нищо от това или правят всичко твърде перфектно (r/webdev, 2026 г.).

Повечето екипи за скрейпинг водят грешната битка

Ето неудобната истина: повечето екипи за скрейпинг все още инвестират предимно в IP инфраструктура. По-големи пулове от proxy сървъри, резидентни IP адреси, ротиращи гейтуеи. Има място за това. Репутацията на IP адреса все още има значение като един сигнал сред многото.

Но купуването на 10 000 резидентни IP адреса няма да помогне, ако отпечатъкът на ниво връзка крещи "Python скрипт" или вашият headless браузър изпуска флагове за автоматизация чрез navigator.webdriver. Харчите пари за грешния слой.

Разработчик, който е изградил 34 продуктови скрейпъра, писа за този проблем (Dev|Journal, март 2026 г.): пропастта между скрейпинг на ниво урок и това, което работи в продукция, се определя от анти-бот системи, които анализират отпечатъците на връзката и движенията на мишката, а не DOM селекторите. Уроците ви учат да парсвате HTML. Продукцията ви учи да оцелеете при откриване.

И става все по-лошо. Докладът на Browserless State of Web Scraping 2026 установи, че стандартните headless браузъри биват маркирани по-често от реалните браузъри, защото анти-бот системите са каталогизирали специфичните разлики в отпечатъците между headless и headed инстанции на браузъра. Тази пропаст не намалява.

Ако вашият скрейпър постоянно се чупи и вие гледате само ротацията на proxy, може би поправяте напълно грешното нещо.

Факторът Cloudflare

Cloudflare заслужава специално внимание, защото те седят от двете страни на тази промяна.

Техният продукт Bot Management извършва поведенчески анализ на всеки request, оценявайки посетителите по скала от 1 до 99 въз основа на десетки сигнали. Turnstile (техният невидим заместител на CAPTCHA) динамично коригира трудността на проверката въз основа на това колко човешки изглежда посетителят (документация на Cloudflare).

В същото време Cloudflare стартира своя собствена AI инфраструктура за обхождане. Общността забеляза иронията (Reddit r/cybersecurity).

Какво означава това на практика: сайтовете, защитени от Cloudflare, са най-трудни за скрейпинг през 2026 г., а приблизително 20% от всички уебсайтове се намират зад тяхната мрежа. Ако вашата стратегия за скрейпинг не отчита поведенческото откриване, вие сте загубили една пета от достъпната мрежа.

Какво всъщност работи през 2026 г.

Успешните скрейпъри споделят три характеристики.

Първо, те съвпадат с подписа на ниво мрежа на актуален браузър. Действителната форма на връзката на ниво байтове трябва да съответства на това, което би извела текуща сесия на Chrome или Firefox. Никакво количество подправяне на header не коригира несъответстващ отпечатък на връзката.

Второ, те използват реални (или убедително реални) браузърни среди. Не headless инстанции с настройки по подразбиране. Действителни инстанции на браузъра с последователни отпечатъци, които съвпадат с User-Agent, за който се представят.

Трето, за защитени сайтове те добавят човекоподобен поведенчески шум. Случайните закъснения не са достатъчни. Времето между действията трябва да следва реалистични разпределения, а пътищата на движение на мишката се нуждаят от криви и колебания, които изглеждат органични.

Така че архитектурата се е променила. Не става въпрос за наличието на повече IP адреси. Става въпрос за това всеки request да бъде неразличим от реален човек, разглеждащ през реален браузър.

Надпреварата във въоръжаването при откриването се ускорява

Доставчиците на анти-бот решения започнаха да споделят разузнавателна информация за заплахи в цялата си клиентска база в реално време. Когато един сайт маркира нов модел на бот, всеки друг сайт в мрежата научава в рамките на минути (SecurityBoulevard, март 2026 г.). Това е фундаментална промяна спрямо стария модел, при който защитата на всеки сайт работеше независимо.

Смятаме, че това означава, че цената на самостоятелно изградената инфраструктура за скрейпинг ще продължи да расте. Всеки нов сигнал за откриване изисква инженерно време за противодействие, а цикълът се ускорява. Екипите, които се справят с откриването на инфраструктурно ниво (интелигентно рутиране на proxy, отпечатъци на браузъра, съпоставяне на ниво връзка), ще надминат тези, които продължават да хвърлят IP адреси по проблема.

Въпросът не е дали имате нужда от повече proxy сървъри. Въпросът е дали вашите заявки изглеждат човешки, преди изобщо да стигнат до целевия сървър.