Le Web classe désormais les bots par finalité, et non par comportement
Chaque système de détection de bots conçu au cours des quinze dernières années pose une seule question : ce trafic a-t-il l'air automatisé ? Ordre des headers, empreintes au niveau du réseau, mouvements de souris, timing des sessions. Tout cela tente de déduire des informations sur le client à partir de la forme de la request.
Le 1er juillet 2026, Cloudflare a changé la question. Le trafic de bots est désormais réparti en trois catégories qui n'ont aucun rapport avec l'apparence d'une request sur le réseau. Search couvre les « crawlers qui indexent votre contenu pour répondre à des questions plus tard ». Agent couvre « l'activité automatisée agissant en temps réel pour le compte d'une personne ». Training couvre les « crawlers qui récupèrent votre contenu pour entraîner ou ajuster un modèle ».
Imaginez trois requests arrivant sur le même serveur. Même client, mêmes headers, même timing, identiques à l'octet près. Selon ce modèle, elles peuvent recevoir trois verdicts différents, déterminés entièrement par ce que vous prévoyez de faire de la page après sa réception.
Il ne s'agit pas d'un meilleur détecteur. C'est une primitive différente.
L'échéance du 15 septembre est plus restreinte que la panique ambiante
La version de cette histoire qui circule sur les forums de développeurs affirme que Cloudflare bloque les agents IA sur un cinquième du web le 15 septembre.
Le changelog indique quelque chose de bien plus limité. Les nouvelles valeurs par défaut s'appliquent aux « nouveaux domaines intégrés à Cloudflare ». Sur ces domaines, « les bots classés comme Training ou Agent sont bloqués sur les pages affichant des publicités, tandis que Search reste autorisé ». Tous les utilisateurs déjà présents sur Cloudflare choisissent leur propre configuration et peuvent le faire à tout moment avant cette date.
En clair : nouveaux domaines uniquement, pages avec publicité uniquement, et l'une des trois catégories passe toujours par défaut. C'est un réel changement, mais ce n'est pas un mur à l'échelle d'Internet.
Mais c'est ce périmètre restreint qui est intéressant. Cloudflare n'a pas publié une politique stricte, il a publié une valeur par défaut, et c'est par les valeurs par défaut qu'une politique devient la norme sans que personne n'ait à voter. Le chiffre à surveiller n'est pas le 15 septembre. C'est le nombre de ces domaines qui ne modifieront jamais ce paramètre par la suite.
Ce que cela signifie : si vous collectez des données, la question utile n'est plus « puis-je contourner la protection de ce site », mais « dans quelle catégorie ce site pense-t-il que je me trouve ». Les réponses sont différentes, et vous ne pouvez en tester qu'une seule.
Une finalité ne se mesure pas. Elle doit être déclarée.
Voici le problème technique posé par le tri du trafic selon l'intention : l'intention ne se trouve pas dans le paquet.
Une empreinte peut être mesurée. Le mouvement de la souris peut être mesuré. La raison pour laquelle vous récupérez cette page ne le peut pas, donc le système a besoin que le client l'énonce clairement, et il lui faut une raison de croire la réponse. C'est exactement le rôle de Web Bot Auth. L'agent signe ses requêtes avec une clé privée, publie un répertoire de clés, et l'edge vérifie la signature par rapport à celui-ci, en s'appuyant sur RFC 9421 HTTP Message Signatures. La documentation de Cloudflare définit le critère d'un bot vérifié comme une identification honnête et volontaire.
Regardez maintenant ce qui applique cela à grande échelle. La spécification est draft-meunier-webbotauth-httpsig-protocol-02, révisée pour la dernière fois le 18 août 2026. Statut prévu: Standards Track. Statut réel: un Internet-Draft actif (individuel) qui n'est pas approuvé par l'IETF et n'a aucune valeur officielle dans le processus de normalisation de l'IETF. Elle compte deux auteurs. L'un travaille chez Cloudflare, l'autre chez Google.
Nous pensons que la conception est bonne, et cela mérite d'être souligné avant d'aborder les critiques. L'identité signée surpasse la course aux armements des pages de vérification pour quiconque a l'intention de bien se comporter. Un crawler qui s'identifie peut être autorisé, limité ou facturé délibérément au lieu d'être deviné, et les propriétaires de sites obtiennent un contrôle qui n'élimine pas les vrais visiteurs par dommage collatéral. Comparez cela à une décennie de blocage de plages IP au petit bonheur la chance.
Ce que ce système ne peut pas faire, c'est arrêter qui que ce soit. Un système basé sur l'intention déclarée ne trie que le trafic qui se déclare. Tout le reste retombe sur la stack de détection déjà en place, et cette stack ne cesse de se perfectionner: le scoring comportemental à l'échelle de la session de Cloudflare a été déployé douze jours après les nouvelles catégories.
Les deux approches ne sont donc pas en concurrence. L'identité trie les acteurs honnêtes, la détection gère tous les autres, et c'est dans cette seconde catégorie que votre trafic atterrit par défaut si vous ne déclarez rien.
Il n'y a pas de case pour la collecte de données publiques
Voici la partie qui devrait inquiéter toute personne exploitant un pipeline de collecte.
Prenez les travaux que nous avons publiés cette année. Un indice des prix du bois construit à partir d'annonces publiques. La détection des violations de prix minimum annoncé (MAP) sur six marketplaces, ce qui implique de récupérer la même page produit depuis six points de vue différents et de comparer les résultats. Les classements sur les app stores et l'analyse de sentiment des avis. Les vérifications de placement publicitaire exécutées depuis le pays où la campagne a réellement été achetée.
Classez tout cela dans Search, Agent ou Training.
Search ne convient pas : la définition même de Cloudflare implique une attente de « trafic de référence ou autre compensation équitable en retour », et une vérification nocturne des prix n'envoie de trafic vers personne. Agent ne convient pas non plus, car aucun être humain n'attend ce fetch devant un écran. Et Training est tout simplement faux, puisque rien n'est absorbé dans un modèle.
Cette taxonomie a été écrite pour décrire le trafic d'IA apparu ces trois dernières années, mais s'applique désormais à un secteur qui la précède d'une décennie. Veille tarifaire, données alternatives, suivi de SERP, protection de marque, vérification publicitaire, contrôle de conformité : rien de tout cela n'est nouveau, rien de tout cela n'est agentique, et rien de tout cela ne dispose d'une case dédiée.
Le trafic sans case attitrée est classé par l'entité qui a dessiné les cases. Généralement dans la plus proche.
Ce que cela implique pour les équipes data
Quatre actions utiles pendant que les règles sont encore souples.
Déterminez quelle catégorie vous revendiqueriez honnêtement. Pas celle qui vous ouvre les portes. Celle que vous défendriez par écrit si un éditeur vous posait directement la question. Si la réponse honnête est « aucune », vous faites partie du groupe qui a le plus à perdre lorsque la taxonomie se durcira, et le plus à gagner à le faire savoir tant que le débat est ouvert.
Lisez les paramètres de la cible, pas les gros titres. La politique de bots d'un site est désormais une propriété spécifique de ce site, configurable par chemin, et elle change sans préavis. Considérer que « Cloudflare bloque les agents en septembre » s'applique d'office à votre pipeline vous poussera à reconstruire des éléments qui n'ont jamais été menacés.
Partez du principe que le test des pages avec publicité va se généraliser. Cloudflare a indexé son comportement par défaut sur les pages affichant des annonces, un proxy raisonnable pour « cette page génère des revenus grâce à l'attention humaine ». Cette limite va évoluer, et Cloudflare n'est pas le seul à la fixer. AWS WAF a lancé la monétisation du trafic d'IA le 15 juin 2026, répondant par une erreur 402 et des modalités de paiement lisibles par machine. Akamai a choisi la voie du partenariat avec TollBit et Skyfire. Trois des plus grands fournisseurs edge vendent désormais la même surface de contrôle, que nous avons analysée sous l'angle de la tarification lors du lancement du pay-per-crawl.
Assurez-vous que votre collecte fonctionne dans les deux voies. La voie identifiée (signer, déclarer, être autorisé ou facturé) et la voie non identifiée (être évalué sur le comportement, comme toujours) vont coexister pendant des années. Construire votre infrastructure comme si une seule de ces options existait constitue l'erreur coûteuse à éviter, dans un sens comme dans l'autre.
Les cases vont être redessinées
Une prédiction que nous assumons pleinement : une quatrième catégorie apparaîtra d'ici un an.
La première version de toute taxonomie est toujours rédigée par ceux qui sont sous pression, et les entités classifiées ne sont pas présentes lors des discussions. Search, Agent et Training décrivent ce que les entreprises d'IA font subir aux éditeurs de contenu. Ils ne décrivent pas un cabinet d'études de marché, une équipe de conformité ou un distributeur surveillant les prix d'un concurrent, alors que ces trois acteurs collectent des pages publiques de manière respectueuse depuis bien avant que le terme "agent" n'ait le moindre sens dans ce contexte.
Le débat sur la dénomination de cette quatrième catégorie, et sur qui a le droit de la sélectionner, aura plus d'impact pour l'industrie des données que n'importe quel benchmark de détection de bots publié cette année. Ce combat mérite votre attention.
Car l'alternative par défaut est limpide. Si votre trafic ne peut pas s'identifier lui-même, quelqu'un d'autre se chargera de le qualifier à votre place.