← Всички публикации

Search, Agent, Training: новите правила за ботове в мрежата

Cloudflare вече класифицира ботовете по цел, а не по поведение: Search, Agent или Training. Настройките по подразбиране от 15 септември са по-тесни от очакваната паника, а едно поле липсва.

Мрежата класифицира ботовете по цел, а не по поведение

Всяка система за bot detection, изградена през последните петнадесет години, задава един въпрос: изглежда ли този трафик автоматизиран? Подредба на header елементи, wire-level отпечатъци, движения на мишката, тайминг на сесиите. Всичко това се опитва да направи извод за клиента от структурата на съответния request.

На 1 юли 2026 г. Cloudflare промени въпроса. Трафикът от ботове вече се разделя в три категории, които нямат нищо общо с това как изглежда даден request на мрежово ниво. Search обхваща "crawlers, които индексират съдържанието ви, за да могат да отговарят на въпроси за него по-късно". Agent обхваща "автоматизирана дейност, действаща в реално време от името на потребител". Training обхваща "crawlers, които вземат съдържанието ви, за да обучават или дообучават модел".

Представете си три request заявки, пристигащи на един и същ сървър. Един и същ клиент, еднакви header стойности, еднакъв тайминг, идентични до последния байт. При този модел те могат да получат три различни решения, определени изцяло от това какво планирате да правите със страницата, след като тя пристигне.

Това не е по-добър детектор. Това е различен примитив.

Крайният срок 15 септември е по-ограничен от паниката

Версията на тази история, която се разпространява из форумите за разработчици, е че Cloudflare блокира AI агенти в една пета от мрежата на 15 септември.

Дневникът с промени описва нещо много по-ограничено. Новите настройки по подразбиране важат за "нови домейни, които се интегрират в Cloudflare". При тези домейни "ботове, класифицирани като Training или като Agent, се блокират на страници, показващи реклами, докато Search остава разрешен". Всички, които вече използват Cloudflare, избират свои собствени настройки и могат да го направят по всяко време преди тази дата.

Следователно: само нови домейни, само страници с реклами и една от трите категории все още преминава по подразбиране. Това е реална промяна, но не е стена през целия интернет.

Но тесният обхват е интересната част. Cloudflare не публикува политика, а публикува настройка по подразбиране, а именно чрез настройките по подразбиране дадена политика се превръща в норма, без никой да гласува за нея. Важната стойност не е 15 септември. Важното е колко от тези домейни никога няма да променят настройката след това.

Какво означава това: ако събирате данни, полезният въпрос вече не е "мога ли да премина през защитата на този сайт", а "в коя категория смята този сайт, че попадам". Те имат различни отговори и само единият от тях е нещо, което можете да тествате.

Целта не може да бъде измерена. Тя трябва да бъде декларирана.

Ето го техническия проблем с класифицирането на трафика по намерение: намерението не се съдържа в пакета.

Fingerprint може да се измери. Движението на мишката може да се измери. "Защо извличате тази страница" не може, така че системата изисква клиентът да го заяви открито, и се нуждае от причина да повярва на отговора. Това е задачата на Web Bot Auth. Агентът подписва своите requests с частен ключ, публикува директория с ключове, а edge сървърът проверява подписа спрямо нея, изградено върху RFC 9421 HTTP Message Signatures. Документацията на Cloudflare определя летвата за верифициран bot като "честна самоидентификация."

Сега вижте какво налага това в мащаб. Спецификацията е draft-meunier-webbotauth-httpsig-protocol-02, последно ревизирана на 18 август 2026 г. Предвиден статус: Standards Track. Действителен статус: "Active Internet-Draft (individual)", който "не е одобрен от IETF" и няма "никакъв официален статут в процеса по стандартизация на IETF." Има двама автори. Единият работи в Cloudflare, другият в Google.

Смятаме, че дизайнът е правилен, и това си струва да се каже преди критиката. Подписаната идентичност побеждава надпреварата с проверки през страници за всеки, който възнамерява да спазва правилата. Crawler, който се идентифицира, може да бъде разрешен, throttled или таксуван целенасочено, вместо да бъде налучкван, а собствениците на сайтове получават контрол, който не засяга реалните посетители като странична жертва. Сравнете това с десетилетие блокиране на IP диапазони и надяване.

Това, което не може да направи, е да спре някого. Система, изградена върху декларирана цел, сортира само трафика, който сам се декларира. Всичко останало се връща към съществуващия стек за детекция, а този стек става все по-прецизен: поведенческото оценяване на ниво сесия от Cloudflare излезе дванадесет дни след новите категории.

Така че двете не се конкурират. Идентичността сортира честните, детекцията обработва всички останали, а във втората категория попада вашият трафик по подразбиране, ако никога не декларирате нищо.

Няма графа за събиране на публични данни

Сега частта, която би трябвало да притесни всеки, поддържащ pipeline за събиране на данни.

Вземете проектите, които публикувахме тази година. Ценови индекс за дървен материал, изграден от публични обяви. Откриване на MAP нарушения в шест платформи за електронна търговия, което означава извличане на една и съща продуктова страница от шест различни точки и сравняване на съдържанието. Класирания в магазини за приложения и анализ на нагласите в отзивите. Проверки за позициониране на реклами, изпълнени от страната, в която кампанията реално е закупена.

Разпределете ги в Search, Agent или Training.

Search не пасва: собствената дефиниция на Cloudflare включва очакване за "реферален трафик или друга справедлива компенсация в замяна", а нощната проверка на цени не изпраща реферали на никого. Agent също не пасва, защото никой човек не седи пред екрана в очакване на тази заявка. А Training е напълно погрешно, тъй като нищо не се абсорбира в модел.

Това е таксономия, създадена да опише AI трафика, появил се през последните три години, която сега се прилага към бизнес, съществуващ от десетилетие преди това. Анализ на цени, алтернативни данни, SERP проследяване, защита на бранда, верификация на реклами, мониторинг на съответствието: нищо от това не е ново, нищо от това не е агентно и за нищо от това няма подходяща категория.

Трафикът без категория се разпределя от този, който е начертал категориите. Обикновено в най-близката възможна.

Какво означава това за екипите по данни

Четири неща, които си струва да направите, докато правилата все още са гъвкави.

Решете коя категория бихте заявили честно. Не тази, която ви осигурява достъп. Тази, която бихте защитили писмено, ако издател ви попита директно. Ако честният отговор е "никоя от тези", вие сте в групата с най-много за губене, когато таксономията се втвърди, и с най-много за печелене, ако го заявите, докато все още има място за диалог.

Четете настройките на таргета, а не заглавията. Политиката за ботове на даден сайт вече е негово собствено свойство, конфигурируемо за всеки path, и се променя без предизвестие. Да приемате "Cloudflare блокира агенти през септември" като факт за вашия pipeline ще ви накара да пренаписвате неща, които никога не са били застрашени.

Приемете, че тестът за страници с реклами ще се разпространи. Cloudflare обвърза настройката си по подразбиране със страници, които показват реклами, добър показател за "тази страница печели от човешко внимание". Тази граница ще се измести, а Cloudflare не е единственият, който я чертае. AWS WAF пусна монетизация на AI трафик на 15 юни 2026 г., отговаряйки с 402 и машинночетими условия за плащане. Akamai избра пътя на партньорството с TollBit и Skyfire. Три от най-големите edge доставчици вече продават една и съща контролна функционалност, която разгледахме откъм ценообразуване когато pay-per-crawl стартира.

Поддържайте събирането на данни готово за работа и в двата режима. Идентифицираният режим (подписване, деклариране, разрешаване или таксуване) и неидентифицираният (оценка според поведението, както винаги) ще съществуват паралелно с години. Да изграждате архитектура, сякаш съществува само единият, е скъпата грешка тук, и в двете посоки.

Категориите ще бъдат преначертани

Прогноза, зад която заставаме уверено: четвърта категория ще се появи в рамките на година.

Първата версия на всяка таксономия се пише от онзи, който е под напрежение, а класифицираните лица не са в стаята, когато това се случва. Search, Agent и Training описват какво правят AI компаниите с издателите. Те не описват фирма за пазарни проучвания, екип по съответствие или търговец на дребно, проверяващ цените на конкурент, а тези три категории извличат публични страници коректно много преди "agent" да означава нещо в този контекст.

Битката за това как ще се нарича това четвърто поле и кой ще има право да го маркира ще има по-голямо значение за индустрията на данните от всеки бенчмарк за бот детекция, публикуван тази година. За нея си струва да се появите.

Защото алтернативата е достатъчно проста. Ако вашият трафик не може сам да се назове, някой друг ще го направи вместо вас.