Веб начинает разделять ботов по цели, а не по поведению
Каждая антибот-система, созданная за последние пятнадцать лет, задает один вопрос: выглядит ли этот трафик автоматизированным? Порядок заголовков, фингерпринты сетевого уровня, движения мыши, тайминги сессий. Все это пытается сделать вывод о клиенте на основе структуры запроса.
1 июля 2026 года Cloudflare изменил этот вопрос. Бот-трафик теперь делится на три категории, которые не имеют ничего общего с тем, как запрос выглядит в сети. Search включает "краулеры, которые индексируют ваш контент, чтобы отвечать на вопросы о нем позже". Agent включает "автоматизированную активность, действующую в реальном времени от имени человека". Training включает "краулеры, которые забирают ваш контент для обучения или дообучения модели".
Представьте три запроса, поступающие на один и тот же сервер. Один и тот же клиент, те же заголовки, те же тайминги, совпадение вплоть до байта. В рамках этой модели они могут получить три разных вердикта, определяемых исключительно тем, что вы планируете делать со страницей после ее получения.
Это не более совершенный детектор. Это другой примитив.
Дедлайн 15 сентября уже, чем кажется в панике
Версия этой истории, циркулирующая на форумах разработчиков, гласит, что Cloudflare заблокирует AI-агентов на пятой части интернета 15 сентября.
Список изменений говорит о гораздо более скромных мерах. Новые настройки по умолчанию применяются только к "новым доменам, подключающимся к Cloudflare". На этих доменах "боты, классифицированные как Training или Agent, блокируются на страницах с рекламой, в то время как Search остается разрешенным". Все, кто уже использует Cloudflare, выбирают свои настройки самостоятельно и могут сделать это в любое время до этой даты.
Итак: только новые домены, только страницы с рекламой, и одна из трех категорий все еще проходит по умолчанию. Это реальное изменение, но не сплошная стена поперек интернета.
Но узкий охват и есть самая интересная часть. Cloudflare опубликовал не политику, а дефолт, а дефолты, это способ превратить правило в норму без общего голосования. Главная дата, это не 15 сентября. Главное, сколько из этих доменов никогда не изменят эту настройку в дальнейшем.
Что это значит: если вы собираете данные, полезный вопрос сменился с "могу ли я обойти защиту сайта" на "к какой категории этот сайт меня относит". У них разные ответы, и только один из них можно протестировать.
Цель нельзя измерить. Ее нужно декларировать.
Вот техническая проблема сортировки трафика по намерениям: намерение не содержится в пакете данных.
Fingerprint можно измерить. Движение мыши можно измерить. Вопрос "зачем вы запрашиваете эту страницу" измерить нельзя, поэтому системе нужно, чтобы клиент сам заявил об этом вслух, и нужны основания верить этому ответу. Именно эту задачу решает Web Bot Auth. Агент подписывает свои request закрытым ключом, публикует каталог ключей, а edge проверяет подпись по нему, на базе RFC 9421 HTTP Message Signatures. Документация Cloudflare определяет критерий верифицированного бота как "честную самоидентификацию".
Теперь посмотрим, что обеспечивает соблюдение этих правил в масштабе. Спецификация draft-meunier-webbotauth-httpsig-protocol-02, последняя редакция от 18 августа 2026 года. Предполагаемый статус: Standards Track. Фактический статус: "Active Internet-Draft (individual)", который "не одобрен IETF" и не имеет "официального статуса в процессе стандартизации IETF". У документа два автора. Один работает в Cloudflare, второй в Google.
Мы считаем эту архитектуру правильной, и это важно отметить до начала критики. Подписанная идентификация выигрывает гонку вооружений с CAPTCHA для всех, кто намерен вести себя корректно. Краулер, который идентифицирует себя, можно осознанно пропустить, ограничить по rate limit или тарифицировать вместо попыток угадать его природу, а владельцы сайтов получают инструмент контроля без риска заблокировать реальных посетителей. Сравните это с десятилетием блокировок диапазонов IP наугад.
Чего эта система сделать не может, так это остановить нарушителей. Система, построенная на декларируемой цели, сортирует только тот трафик, который заявляет о себе сам. Все остальное возвращается к уже существовавшему стеку обнаружения, и этот стек становится все точнее: поведенческий скоринг на уровне сессий от Cloudflare вышел через двенадцать дней после появления новых категорий.
Так что они не конкурируют между собой. Идентификация сортирует честных, обнаружение обрабатывает всех остальных, и именно во вторую категорию ваш трафик попадает по умолчанию, если вы ничего не декларируете.
Категории для сбора публичных данных не предусмотрено
А теперь часть, которая должна насторожить любого, кто запускает пайплайн сбора данных.
Возьмем кейсы, опубликованные нами в этом году. Индекс цен на пиломатериалы, построенный на базе публичных объявлений. Отслеживание нарушений MAP на шести маркетплейсах, что означает загрузку одной и той же страницы товара из шести разных точек и сравнение результатов. Рейтинги в магазинах приложений и анализ тональности отзывов. Проверка размещения рекламы из той страны, где кампания была фактически закуплена.
Попробуйте распределить это по категориям Search, Agent или Training.
Search не подходит: собственное определение Cloudflare предполагает ожидание "реферального трафика или иной справедливой компенсации взамен", а ночная проверка цен никому не дает рефералов. Agent тоже не подходит, потому что никакой человек не сидит перед экраном в ожидании этого fetch. А Training откровенно ошибочен, поскольку ничего не загружается в модель.
Эта таксономия была написана для описания трафика ИИ, появившегося за последние три года, а теперь применяется к бизнесу, возникшему на десять лет раньше. Мониторинг цен, альтернативные данные, отслеживание SERP, защита бренда, верификация рекламы, контроль соответствия требованиям: все это не ново, не относится к агентам и не имеет подходящего чекбокса.
Трафик без категории классифицируется теми, кто эти категории создал. Обычно в ближайшую подходящую.
Что это значит для команд работы с данными
Четыре шага, которые стоит предпринять, пока правила еще формируются.
Решите, какую категорию вы готовы честно заявить. Не ту, которая позволит пройти проверку прямо сейчас. А ту, которую вы сможете письменно защитить, если издатель спросит напрямую. Если честный ответ "ни одна из них", вы в группе с наибольшими рисками при фиксации таксономии, и с наибольшей выгодой от открытого заявления об этом, пока еще идут обсуждения.
Изучайте настройки целевого ресурса, а не заголовки новостей. Политика сайта в отношении ботов теперь является свойством самого сайта, настраивается для каждого пути и меняется без предупреждения. Восприятие тезиса "Cloudflare блокирует агентов в сентябре" как факта о вашем пайплайне заставит вас переделывать то, чему ничего не угрожало.
Исходите из того, что проверка страниц с рекламой станет повсеместной. Cloudflare привязал поведение по умолчанию к страницам с рекламой, что служит хорошим маркером для критерия "эта страница зарабатывает на внимании людей". Эта граница сдвинется, и Cloudflare не единственный, кто ее проводит. AWS WAF представил монетизацию трафика ИИ 15 июня 2026 года, отвечая кодом 402 и машиночитаемыми условиями оплаты. Akamai пошел по пути партнерства с TollBit и Skyfire. Три крупнейших edge провайдера теперь предлагают одинаковый механизм контроля, который мы разбирали с точки зрения ценообразования, когда запустилась модель оплаты за краулинг.
Сохраняйте возможность сбора данных по обоим направлениям. Идентифицированный подход (подписать, объявить, получить доступ или счет) и неидентифицированный подход (оценка по поведению, как и раньше) будут сосуществовать годами. Разработка решений так, будто существует только один из них, станет дорогостоящей ошибкой в любом случае.
Категории будут пересмотрены
Прогноз, за который мы готовы отвечать: четвертая категория появится в течение года.
Первую версию любой таксономии пишет тот, кто находится под давлением, и тех, кого классифицируют, в этот момент в комнате нет. Категории Search, Agent и Training описывают то, как AI-компании взаимодействуют с издателями. Они не описывают компании по исследованию рынка, отделы комплаенса или ритейлеров, проверяющих цены конкурентов на полках, хотя все эти три группы корректно собирали публичные страницы задолго до того, как слово "agent" вообще приобрело значение в этом контексте.
Борьба за то, как будет называться этот четвертый пункт и кто получит право его выбирать, будет значить для индустрии данных больше, чем любой опубликованный в этом году бенчмарк по защите от ботов. Ради этого стоит включиться в процесс.
Потому что запасной сценарий предельно прост. Если ваш трафик не может идентифицировать себя сам, кто-то другой сделает это за вас.