19 февраля 2026 года Stack Overflow и Cloudflare объявили о решении, которого большая часть индустрии веб-данных не ожидала. Они совместно запустили модель pay-per-crawl: систему, в которой AI-краулеры получают в реальном времени 402 Payment Required response и могут либо заплатить установленную издателем цену, либо уйти. Идентификация бота проверяется на edge-серверах, цену задает сам сайт, транзакция тарифицируется.
Cloudflare обслуживает примерно каждый пятый сайт в интернете. Поэтому, когда они включили блокировку известных AI-ботов по умолчанию и развернули маркетплейс, где издатели взимают плату за request, модель доступа к огромной части открытого веба изменилась за одни выходные.
Если вы разрабатываете инфраструктуру для сбора веб-данных прямо сейчас, это не просто очередная новость от Cloudflare. Это событие меняет экономику того, что принято считать «открытым».
Механика изменений
Техническая часть проста. Cloudflare вернула к жизни HTTP 402, давно забытый статус-код «Payment Required», и связала его с реестром верифицированных AI-краулеров. Издатель задает цену за request. Краулер либо имеет баланс на счете и платит, либо блокируется.
Организационная часть гораздо масштабнее. До этого единственными способами запретить сбор контента для AI были robots.txt (носят рекомендательный характер, не принудительны) и агрессивная блокировка ботов (бинарная, с потерями и множеством ложных срабатываний). Cloudflare добавила третий вариант: ценник.
Экономика этого третьего варианта устроена иначе, чем у первых двух. Robots.txt ничего не стоит и игнорируется. Блокировка ботов лишает вас трафика реальных пользователей, ошибочно принятых за ботов. Ценник намеренно разделяет краулеры на те, которые готовы платить, и те, которые платить не готовы.
Кто берет плату на практике
Stack Overflow стал стартовым партнером, так как их обучающие данные действительно ценны, и они уже вели прямые переговоры с OpenAI и другими игроками. Маркетплейс Cloudflare превратил эти двусторонние сделки в единый реестр, к которому может подключиться любой издатель.
Список последователей вырос быстро. AWS выпустила собственный уровень монетизации ботов. Akamai создала аналогичное решение. Предложение издателям предельно понятно: вместо одного дорогого судебного процесса против AI-лаборатории вы получаете постоянный доход за каждый request.
На данный момент это касается в основном ценного контента: документации, новостей, технических вопросов и ответов, структурированных справочных данных. Длинный хвост веба (небольшие сайты электронной коммерции, региональные каталоги, нишевые форумы) не защищен такими барьерами и, вероятно, никогда не будет. Работа бот-менеджмента Cloudflare стоит денег, а подключение к pay-per-crawl добровольное. Это выгодно только тем сайтам, где просмотр отдельной страницы действительно оправдывает оплату.
Что это значит для пайплайнов веб-данных
Если вы строите пайплайн, собирающий данные со Stack Overflow, крупных новостных сайтов или других активно подключающихся издателей, варианты сводятся к трем. Платить через маркетплейс, как только ваш трафик будет распознан как AI-краулер. Переходить на лицензированный датасет там, где он есть. Или искать данные там, где они все еще открыты.
Большинству команд придется использовать все три подхода в разное время. Такова практическая реальность. Веб делится на лицензированный и открытый, причем граница не проходит строго по доменам. У одного и того же издателя один раздел может отдавать 402, а другой оставаться открытым. Один и тот же сайт может брать плату с одного краулера и полностью игнорировать исследовательского бота.
Мы считаем, что практические шаги для инженерных команд должны быть следующими. Во-первых, проведите аудит источников. Если существенная часть вашего пайплайна завязана на Stack Overflow, Reddit, крупные новостные сайты или любого из десятков издателей, открыто идущих на такие сделки, исходите из того, что модель доступа изменится в течение двенадцати месяцев. Во-вторых, заранее разделите лицензированные и открытые источники на уровне архитектуры. Пайплайн, который обрабатывает все источники одинаково, сломается, когда половина из них начнет требовать деньги, а другая половина нет. В-третьих, перестаньте считать robots.txt единственным сигналом. Ответ 402 будет иметь операционное значение, даже если ваш краулер не является AI-агентом. Ложные срабатывания неизбежны в столь новой системе.
Это идет рука об руку с требованиями к обучающим данным по закону EU AI Act, которые уже подтолкнули команды к источникам с проверяемым происхождением. Модель pay-per-crawl добавляет к этому же давлению биллинговый слой.
Честный взгляд
Несколько моментов создадут проблемы. Верификация от Cloudflare держится на регистрации ботов. Боты, которые не регистрируются или маскируются под резидентный трафик, вообще не вызывают ошибку 402. Вместо этого они упираются в стандартную защиту от ботов. Большинство агрессивных AI-краулеров уже идет по этому пути. Поэтому pay-per-crawl работает только для тех ботов, которые хотят соблюдать правила. Те, кто этого не хочет, и раньше не собирались соблюдать robots.txt.
Главный сдвиг может заключаться даже не в самом маркетплейсе. Дело в том, что вопрос доступности контента для обучения AI получил контрактный ответ вместо догадок по robots.txt. Издатели наконец-то могут применять правила. Краулеры наконец-то получают определенность. Серая зона уменьшается везде, куда дотягивается маркетплейс.
Серой остается вся остальная часть сети. Небольшой сайт без Cloudflare, региональный агрегатор без стратегии по AI, длинный хвост сайтов, о которых никто не ведет переговоров: они не выдают 402 и не получают лицензионных соглашений. Они сохраняют прежнюю политику доступа, просто протестуют громче теперь, когда появился прецедент компенсаций.
Куда все идет
Два прогноза, и они отнюдь не гарантированные.
Первое: в ближайшие двенадцать месяцев появится второй уровень пейволлов, на этот раз для ботов, не связанных с AI. Механика маркетплейса сводится лишь к HTTP-коду ответа и биллинговому слою. Технически несложно распространить это на тарификацию поисковых краулеров, архивных ботов или мониторинга конкурентов. Удержат ли издатели границу, взимая плату только с AI-краулеров, зависит от поведения следующей волны. Обычно эта граница не выдерживает.
Второе: AI-лаборатории найдут обходные пути. Не через игнорирование 402 (это легко отследить и оспорить в суде), а покупая лицензированные датасеты оптом и пропуская весь остальной трафик под видом реальных пользователей. Cloudflare уже внедряет больше поведенческого анализа именно потому, что понимает это. Мы наблюдаем, как эта гонка вооружений смещается к сигналам уровня сессий, уже два года. Маркетплейсом все не закончится.
Главный вопрос для разработчиков заключается не в том, платить ли. Вопрос в том, где открытый веб останется открытым, и как долго.