На 19 февруари 2026 г. Stack Overflow и Cloudflare обявиха публично нещо, което по-голямата част от индустрията за уеб данни не очакваше. Те стартираха съвместно pay-per-crawl: система, при която AI ботовете за обхождане получават 402 Payment Required отговор в реално време и могат или да платят цената на издателя, или да се откажат. Самоличността на бота се верифицира на edge ниво, цената се определя от сайта, а трансакцията се отчита.
Cloudflare стои пред приблизително един на всеки пет сайта в интернет. Така че, когато те превключиха към блокиране по подразбиране за известни AI ботове и изградиха пазар, в който издателите таксуват на заявка, моделът за достъп до огромна част от отворения уеб се промени за един уикенд.
Ако в момента разработвате инфраструктура за уеб данни, това не е просто поредното съобщение от Cloudflare, което да пренебрегнете. То променя сметката за това какво означава "отворен".
Механиката зад промяната
Техническата стъпка е малка. Cloudflare възкреси HTTP 402, отдавна неизползвания статус код "Payment Required", и го свърза с регистър на верифицирани AI ботове. Издателят задава цена за заявка. Ботът или разполага с кредитен баланс и плаща, или бива блокиран.
Нетехническата стъпка е по-голяма. Преди това единствените начини за налагане на правилото "не скрапвайте съдържанието ми за AI" бяха robots.txt (препоръчителен, без принудително изпълнение) и агресивно блокиране на ботове (бинарно, със загуби и пълно с фалшиви положителни резултати). Cloudflare добави трета опция: ценови етикет.
Икономиката на тази трета опция работи по различен начин от първите две. Robots.txt не струва нищо и бива игнориран. Блокирането на ботове ви коства трафик от реални потребители, погрешно класифицирани като ботове. Ценовият етикет по дизайн отделя ботовете, които са готови да плащат, от тези, които не са.
Кой всъщност таксува
Stack Overflow беше стартовият партньор, тъй като техните данни за обучение са наистина ценни и те вече преговаряха по двустранни сделки с OpenAI и други. Пазарът на Cloudflare обобщи тези двустранни сделки в регистър, към който останалата част от издателския свят може да се включи.
Списъкът с последвалите ги нарасна бързо. AWS пусна собствен слой за монетизация на ботове. Akamai изгради паралелен такъв. Предложението към издателите е ясно: вместо едно скъпо съдебно дело срещу AI лаборатория, получавате приходен поток, който плаща на всяка заявка.
Засега това засяга предимно сегмента с високостойностно съдържание: документация, новини, технически въпроси и отговори, структурирани референтни данни. Дългата опашка на мрежата (малки сайтове за електронна търговия, регионални обяви, нишови форуми) не се намира зад такава бариера и вероятно никога няма да бъде. Поддръжката на bot management на Cloudflare струва пари, а pay-per-crawl се активира по избор. Има финансов смисъл само за сайтове, при които си струва да се таксува единично показване на страница.
Какво означава това за пайплайните за уеб данни
Ако изграждате pipeline, който извлича данни от Stack Overflow, големи новинарски сайтове или някой от издателите, които активно се включват, опциите ви се свеждат до три. Плащане през пазара, щом трафикът ви бъде разпознат като AI crawler. Преминаване към лицензиран набор от данни, където има такъв. Или намиране на данните някъде, където все още са свободно достъпни.
Повечето екипи в крайна сметка ще приложат и трите подхода в различно време. Това е практическата реалност. Мрежата се разделя на лицензирана и отворена, като границата не минава ясно по линиите на домейните. Един и същ издател може да постави една секция зад 402, а друга да остави свободна. Един и същ сайт може да таксува един crawler и напълно да игнорира изследователски бот.
Смятаме, че практическата реакция за инженерните екипи изглежда така. Първо, направете одит на източниците си. Ако значителна част от вашия pipeline тегли данни от Stack Overflow, Reddit, големи новинарски сайтове или някой от дузината издатели, които видимо търсят такива сделки, приемете, че моделът на достъп ще се промени в рамките на дванадесет месеца. Второ, разделете лицензираните източници от отворените във вашата архитектура още на ранен етап. Pipeline, който третира всеки източник идентично, е крехък, когато половината от тях започнат да искат пари, а другата половина не. Трето, спрете да приемате robots.txt като единствен сигнал. Отговорът 402 ще има оперативно значение дори ако вашият crawler не е AI агент. Фалшивите положителни резултати са неизбежни в толкова нова система.
Това идва паралелно с натиска за съответствие при данните за обучение от Законодателния акт на ЕС за AI (EU AI Act), който вече насочи екипите към източници с проследим произход. Моделът pay-per-crawl е същият натиск, но с добавен слой за таксуване.
Честният поглед
Няколко неща ще създадат проблеми. Проверката на самоличността на Cloudflare разчита на това ботовете да се регистрират. Ботовете, които не се регистрират или изглеждат като жилищен (residential) трафик, изобщо не задействат 402. Вместо това те се сблъскват със стандартната защита срещу ботове. Това вече е пътят, по който ще поемат повечето агресивни AI crawlers. Така че pay-per-crawl работи за ботовете, които искат да спазват правилата. Тези, които не искат, така или иначе нямаше да зачитат и robots.txt.
По-голямата промяна може да не е самият маркетплейс. Тя е в това, че въпросът „достъпно ли е това съдържание за обучение на AI“ получи договорен отговор вместо предположение от robots.txt. Издателите най-накрая могат да налагат контрол. Crawlers най-накрая могат да знаят със сигурност. Сивата зона намалява там, докъдето стига маркетплейсът.
Това, което остава в сивата зона, е всичко извън него. Малкият сайт без Cloudflare, регионалният агрегатор без стратегия за AI, дългата опашка на мрежата, за която никой не преговаря: те не връщат 402, нито получават лицензионна сделка. Те запазват политиката за достъп, която са имали преди, просто с по-силен протест сега, когато има прецедент за компенсация.
Накъде отива това
Две прогнози, и те не са сигурни.
Първо: през следващите дванадесет месеца ще се появи второ ниво на paywall, този път за ботове извън AI. Пазарният механизъм е просто HTTP status code и слой за таксуване. Технически не е трудно да се разшири до ценообразуване за search crawler-и, archive ботове или мониторинг на конкуренти. Дали издателите ще се ограничат с таксуване само на AI crawler-и зависи от поведението на следващата вълна. В повечето случаи тази граница пада.
Второ: лабораториите за AI ще го заобиколят. Не чрез игнориране на 402 (това е проследимо и подлежи на съдебни спорове), а чрез закупуване на лицензирани масиви от данни на едро и след това прекарване на всичко останало през трафик, който изглежда като реални потребители. Cloudflare вече пуска повече поведенческа детекция точно защото са наясно с това. Наблюдаваме преместването на тази надпревара към сигнали на ниво сесия от две години насам. Това не приключва с един маркетплейс.
Интересният въпрос за създателите не е дали да плащат. А къде отворената мрежа остава отворена и за колко време.