← Все статьи

Search, Agent, Training: новые правила для ботов в вебе

Cloudflare теперь разделяет ботов по назначению, а не поведению: Search, Agent или Training. Настройки по умолчанию от 15 сентября мягче, чем ожидалось, но одной категории не хватает.

Веб начинает разделять ботов по цели, а не по поведению

Каждая система защиты от ботов, созданная за последние пятнадцать лет, задает один вопрос: похож ли этот трафик на автоматизированный? Порядок header, фингерпринты на уровне протоколов, движения мыши, тайминги сессий. Все это пытается определить природу клиента по структуре самого request.

1 июля 2026 года Cloudflare изменил постановку вопроса. Теперь бот-трафик делится на три категории, которые не имеют ничего общего с тем, как request выглядит в сети. Search включает «краулеры, которые индексируют ваш контент, чтобы отвечать на вопросы о нем позже». Agent охватывает «автоматизированные действия, выполняемые в реальном времени от имени пользователя». Training включает «краулеры, собирающие ваш контент для обучения или дообучения моделей».

Представьте три request, поступающие на один и тот же сервер. Один и тот же клиент, те же header, те же тайминги, совпадение вплоть до байта. В рамках этой модели они могут получить три разных вердикта, зависящих исключительно от того, что вы собираетесь делать со страницей после ее получения.

Это не просто более совершенный детектор. Это принципиально другой примитив.

Дедлайн 15 сентября оказался уже, чем вызванная им паника

Версия, циркулирующая на форумах разработчиков, сводится к тому, что 15 сентября Cloudflare заблокирует AI-агентов на пятой части всего веба.

Журнал изменений говорит о куда более скромных масштабах. Новые настройки по умолчанию применяются к «новым доменам, подключаемым к Cloudflare». На таких доменах «боты, классифицированные как Training или Agent, блокируются на страницах с рекламой, в то время как категория Search остается разрешенной». Все, кто уже использует Cloudflare, выбирают настройки самостоятельно и могут сделать это в любой момент до указанной даты.

Итак: только новые домены, только страницы с рекламой, и одна из трех категорий все еще проходит по умолчанию. Это заметный сдвиг, но далеко не тотальная стена поперек интернета.

Однако именно узкий охват представляет главный интерес. Cloudflare опубликовал не просто политику, а дефолтные настройки, а именно дефолты превращают политику в стандарт без всякого голосования. Главная метрика здесь не дата 15 сентября. Главное то, сколько из этих доменов никогда не изменят эти настройки в будущем.

Что это значит: если вы занимаетесь сбором данных, главный вопрос сместился с «могу ли я обойти защиту этого сайта» на «к какой категории этот сайт меня относит». У этих вопросов разные ответы, и только один из них поддается прямому тестированию.

Намерение нельзя измерить. Его можно только задекларировать.

Вот ключевая техническая проблема разделения трафика по намерениям: намерение не содержится внутри сетевого пакета.

Цифровой отпечаток можно измерить. Движение мыши можно измерить. Вопрос «зачем вы запрашиваете эту страницу» измерить нельзя, поэтому системе нужно, чтобы клиент заявил об этом прямо, а также нужен повод поверить ответу. Именно эту задачу решает Web Bot Auth. Агент подписывает свои запросы закрытым ключом и публикует каталог ключей, а edge проверяет подпись по нему на базе RFC 9421 HTTP Message Signatures. Документация Cloudflare определяет планку для верифицированного бота как «честную самоидентификацию».

Теперь посмотрим, что обеспечивает соблюдение этого в масштабе. Спецификация, draft-meunier-webbotauth-httpsig-protocol-02, последняя редакция от 18 августа 2026 года. Предполагаемый статус: Standards Track. Фактический статус: «Active Internet-Draft (individual)», который «не одобрен IETF» и «не имеет формального статуса в процессе стандартизации IETF». У него два автора. Один работает в Cloudflare, другой, в Google.

Мы считаем эту архитектуру правильной, и об этом стоит сказать до перехода к критике. Подписанная идентификация выигрывает гонку вооружений со страницами проверки для всех, кто намерен вести себя добросовестно. Краулер, который идентифицирует себя, можно целенаправленно пропустить, ограничить по rate limit или тарифицировать вместо угадывания, а владельцы сайтов получают инструмент контроля, не задевающий реальных посетителей. Сравните это с десятилетием блокировок диапазонов IP наугад.

Чего эта система не может сделать, так это остановить кого-либо. Механизм, построенный на декларируемой цели, сортирует только тот трафик, который заявляет о себе сам. Все остальное возвращается к уже существовавшему стеку обнаружения, и этот стек постоянно совершенствуется: поведенческий скоринг на уровне сессий от Cloudflare вышел через двенадцать дней после релиза новых категорий.

Так что они не конкурируют. Идентификация сортирует честных, обнаружение обрабатывает всех остальных, и именно во вторую категорию по умолчанию попадает ваш трафик, если вы ничего не декларируете.

Для сбора публичных данных нет отдельной категории

А теперь часть, которая должна насторожить любого, кто запускает пайплайн сбора данных.

Возьмем кейсы, опубликованные нами в этом году. Индекс цен на пиломатериалы, построенный на базе публичных объявлений. Поиск нарушений MAP на шести маркетплейсах, что означает загрузку одной и той же страницы товара из шести разных точек и сопоставление результатов. Рейтинги в магазинах приложений и тональность отзывов. Проверка размещения рекламы из страны, где кампания была фактически куплена.

Попробуйте распределить это по категориям Search, Agent или Training.

Search не подходит: собственное определение Cloudflare предполагает «реферальный трафик или иную соразмерную компенсацию взамен», а ночной мониторинг цен никому не отправляет рефералов. Agent тоже не подходит, поскольку за экраном нет человека, ожидающего результат этого запроса. А Training явно не у дел, так как данные не используются для обучения модели.

Эта таксономия была создана для описания AI трафика, появившегося за последние три года, а теперь применяется к процессам, существовавшим на десять лет раньше. Мониторинг цен, альтернативные данные, отслеживание SERP, защита бренда, верификация рекламы, контроль соответствия требованиям: все это не ново, не относится к агентам и не имеет отдельного чекбокса.

Трафик без чекбокса распределяется теми, кто создал эту классификацию. Обычно в ближайшую категорию.

Что это значит для команд работы с данными

Четыре шага, которые стоит предпринять, пока правила еще не зафиксированы окончательно.

Определите, к какой категории вы честно относитесь. Не к той, которая просто позволяет пройти проверку, а к той, которую вы готовы обосновать письменно, если издатель спросит напрямую. Если честный ответ «ни к одной из них», то вы в группе с наибольшими рисками при ужесточении таксономии, но и с наибольшей выгодой от открытого заявления об этом, пока еще есть место для диалога.

Изучайте настройки конкретного ресурса, а не заголовки. Политика сайта в отношении ботов теперь задается на уровне самого ресурса, настраивается для каждого пути и меняется без предупреждения. Если воспринимать новость «Cloudflare блокирует агентов в сентябре» как данность для вашего пайплайна, вы рискуете начать переделывать то, чему ничего не угрожало.

Исходите из того, что подход с рекламными страницами станет стандартом. Cloudflare привязал поведение по умолчанию к страницам с рекламой, что служит маркером для критерия «эта страница монетизирует внимание людей». Эта граница будет смещаться, и Cloudflare не единственный, кто ее проводит. AWS WAF представил монетизацию AI трафика 15 июня 2026 года, возвращая статус 402 и машиночитаемые условия оплаты. Akamai выбрал партнерство с TollBit и Skyfire. Три крупнейших edge провайдера теперь предлагают аналогичный уровень контроля, который мы рассматривали с точки зрения ценообразования, когда запустилась модель pay-per-crawl.

Обеспечьте работу сбора данных в обоих режимах. Идентифицированный режим (подписать, объявить, получить доступ или счет) и неидентифицированный (оценка по поведению, как и раньше) будут сосуществовать годами. Проектировать систему в расчете только на один из них это дорогостоящая ошибка в любом направлении.

Классификацию пересмотрят

Прогноз, за который мы готовы отвечать: четвертая категория появится в течение года.

Первую версию любой таксономии пишет тот, кто находится под давлением, и тех, кого классифицируют, в этот момент в комнате нет. Search, Agent и Training описывают то, что ИИ-компании делают с сайтами издателей. Они не описывают аналитическую компанию, отдел комплаенса или ритейлера, проверяющего цены конкурентов, хотя все они аккуратно собирали публичные страницы задолго до того, как слово "agent" приобрело здесь хоть какой-то смысл.

Борьба за то, как будет называться этот четвертый пункт и кто получит право его выбирать, будет значить для индустрии данных больше, чем любой бенчмарк по обнаружению ботов, опубликованный в этом году. Ради этого стоит включиться в процесс.

Потому что альтернатива предельно проста. Если ваш трафик не может идентифицировать себя сам, кто-то другой сделает это за вас.