Всички публикации

Search, Agent, Training: новите правила за ботове в мрежата

Cloudflare вече класифицира ботовете по цел, а не по поведение: Search, Agent или Training. Настройките по подразбиране от 15 септември са по-тесни от очакваната паника, а едно поле липсва.

Мрежата започва да класифицира ботовете по цел, а не по поведение

Всяка система за защита от ботове, създадена през последните петнадесет години, задава един въпрос: изглежда ли този трафик автоматизиран? Подредба на header елементите, отпечатъци на мрежово ниво, движение на мишката, тайминг на сесията. Всичко това се опитва да извлече изводи за клиента от структурата на самата request заявка.

На 1 юли 2026 г. Cloudflare промени въпроса. Трафикът от ботове вече се разделя на три категории, които нямат нищо общо с това как изглежда дадена заявка на ниво мрежов пренос. Search обхваща "crawlers, които индексират съдържанието ви, за да могат да отговарят на въпроси за него по-късно." Agent покрива "автоматизирана активност, действаща в реално време от името на потребител." Training включва "crawlers, които взимат съдържанието ви, за да обучават или донастройват модел."

Представете си три request заявки, пристигащи на един и същ сървър. Един и същ клиент, еднакви headers, идентичен тайминг, съвпадащи до последния байт. При този модел те могат да получат три различни решения, определени изцяло от това какво планирате да правите със страницата, след като я получите.

Това не е по-добър детектор. Това е напълно различен примитив.

Крайният срок 15 септември е по-тесен от създалата се паника

Версията на тази история, която обикаля форумите за разработчици, е че Cloudflare блокира AI агенти в една пета от мрежата на 15 септември.

Дневникът с промени описва нещо много по-ограничено. Новите настройки по подразбиране важат за "нови домейни, добавяни към Cloudflare." При тези домейни "ботовете, класифицирани като Training или Agent, се блокират на страници с реклами, докато Search остава разрешен." Всеки, който вече използва Cloudflare, избира своя собствена настройка и може да го направи по всяко време преди тази дата.

Така че: само нови домейни, само страници с реклами, като една от трите категории все още се пропуска по подразбиране. Това е реална промяна, но не представлява стена пред целия интернет.

Но ограниченият обхват е интересната част. Cloudflare не публикува политика, а публикува стойност по подразбиране, а стойностите по подразбиране са начинът, по който една политика става норма, без никой да гласува за нея. Важното число тук не е 15 септември. Важното е колко от тези домейни никога няма да променят тази настройка след това.

Какво означава това: ако събирате данни, полезният въпрос вече не е "мога ли да премина през защитата на този сайт", а "в коя категория смята този сайт, че попадам". Тези въпроси имат различни отговори и само за единия от тях може да направите тест.

Целта не може да бъде измерена. Тя трябва да бъде декларирана.

Ето го и техническия проблем с класифицирането на трафика по намерение: намерението не се съдържа в пакета.

Фингърпринтът може да се измери. Движението на мишката може да се измери. „Защо извличате тази страница“ не може, така че системата изисква клиентът да го заяви открито и се нуждае от причина да повярва на отговора. Това е задачата на Web Bot Auth. Агентът подписва своите requests с частен ключ, публикува директория с ключове, а edge сървърът проверява подписа спрямо нея, изграден върху RFC 9421 HTTP Message Signatures. Документацията на Cloudflare определя критерия за верифициран бот като „честна самоидентификация“.

Сега вижте какво налага това в мащаб. Спецификацията е draft-meunier-webbotauth-httpsig-protocol-02, последно редактирана на 18 август 2026 г. Предвиден статус: Standards Track. Действителен статус: „Active Internet-Draft (individual)“, който „не е одобрен от IETF“ и няма „официален статут в процеса на стандартизация на IETF“. Има двама автори. Единият работи в Cloudflare, другият работи в Google.

Смятаме, че дизайнът е правилен, и това си струва да се каже, преди да започне критиката. Подписаната идентичност побеждава надпреварата с CAPTCHA за всеки, който възнамерява да спазва правилата. Краулер, който се идентифицира, може да бъде разрешен, ограничен или таксуван целенасочено, вместо да бъде налучкван, а собствениците на сайтове получават контрол, който не засяга реалните посетители като странична жертва. Сравнете това с десетилетие на блокиране на IP диапазони и надяване на късмет.

Това, което не може да направи, е да спре когото и да било. Система, изградена върху декларирана цел, сортира само трафика, който се декларира сам. Всичко останало се връща към стека за засичане, който вече съществуваше, и този стек става все по-прецизен: поведенческото оценяване на ниво сесия на Cloudflare беше пуснато дванадесет дни след новите категории.

Така че двете не се конкурират. Идентичността сортира честните, засичането поема всички останали, а второто е мястото, където вашият трафик попада по подразбиране, ако никога не декларирате нищо.

Няма категория за събиране на публични данни

Сега частта, която би трябвало да притесни всеки, който управлява pipeline за събиране на данни.

Вземете работата, която публикувахме тази година. Ценови индекс за дървен материал, изграден от публични обяви. Откриване на нарушения на MAP в шест маркетплейса, което означава извличане на една и съща продуктова страница от шест различни гледни точки и сравняване на съдържанието им. Класирания в магазини за приложения и анализ на нагласите в отзивите. Проверки за позициониране на реклами, изпълнени от страната, в която кампанията реално е закупена.

Разпределете ги в Search, Agent или Training.

Search не пасва: собственото определение на Cloudflare включва очакване за "referral трафик или друга справедлива компенсация в замяна", а една нощна проверка на цени не изпраща referrals на никого. Agent също не пасва, защото никой човек не седи пред екрана в очакване на това извличане. А Training е напълно погрешно, тъй като нищо не се абсорбира в модел.

Това е таксономия, създадена да опише AI трафика, появил се през последните три години, която сега се прилага към бизнес, предшестващ го с десетилетие. Анализ на цени, алтернативни данни, проследяване на SERP, защита на бранда, верификация на реклами, мониторинг на съответствието: нищо от това не е ново, нищо от това не е agentic и за нищо от това няма отделна категория.

Трафикът без категория се класифицира от онзи, който е създал категориите. Обикновено в най-близката възможна.

Какво означава това за екипите за данни

Четири неща, които си струва да направите, докато правилата все още са гъвкави.

Решете коя категория бихте заявили честно. Не тази, която ви осигурява достъп. Тази, която бихте защитили писмено, ако издател ви попита директно. Ако честният отговор е "нито една от тези", тогава сте в групата с най-много за губене, когато таксономията се втвърди, и с най-много за печелене, ако го заявите, докато все още има място за дискусия.

Четете настройките на целевия сайт, а не заглавията по медиите. Политиката за ботове на даден сайт вече е негово индивидуално свойство, конфигурируемо за всеки path, и се променя без предупреждение. Ако приемете "Cloudflare блокира агенти през септември" като абсолютен факт за вашия pipeline, ще започнете да пренаписвате неща, които никога не са били застрашени.

Приемете, че тестът за страници с реклами ще се разпространи. Cloudflare обвърза настройката си по подразбиране със страници, показващи реклами, което е добър показател за "тази страница печели от човешко внимание". Тази граница ще се измести и Cloudflare не е единственият, който я налага. AWS WAF пусна AI traffic monetization на 15 юни 2026 г., отговаряйки с 402 и машинночетими условия за плащане. Akamai избра пътя на партньорството с TollBit и Skyfire. Три от най-големите edge доставчици вече предлагат един и същ контролен панел, който разгледахме от ценова гледна точка при стартирането на pay-per-crawl.

Поддържайте събирането на данни готово за работа и в двата режима. Идентифицираният режим (подписвате, декларирате, получавате достъп или ви таксуват) и неидентифицираният (оценяват ви според поведението, както винаги) ще съществуват паралелно с години. Изграждането на архитектура, сякаш съществува само единият от тях, е скъпа грешка и в двата случая.

Категориите ще бъдат пренаписани

Прогноза, зад която заставаме уверено: четвърта категория ще се появи в рамките на една година.

Първата версия на всяка таксономия се пише от този, който е под натиск, а класифицираните лица не присъстват в залата, когато това се случва. Search, Agent и Training описват какво правят AI компаниите с издателите. Те не описват фирма за пазарни проучвания, екип по съответствие или търговец на дребно, който проверява цените на конкурент, а тези три категории извличат публични страници коректно отпреди "agent" да означава каквото и да било в този контекст.

Борбата за това как се нарича това четвърто поле и кой има право да го маркира, ще има по-голямо значение за индустрията за данни от всеки бенчмарк за защита срещу ботове, публикуван тази година. За тази битка си струва да се появите.

Защото алтернативата е достатъчно проста. Ако вашият трафик не може да се идентифицира сам, някой друг ще го направи вместо вас.