La web está clasificando a los bots por propósito, no por comportamiento
Todos los sistemas antibot creados en los últimos quince años se hacen una pregunta: ¿este tráfico parece automatizado? El orden de los headers, las huellas digitales a nivel de red, el movimiento del ratón, los tiempos de sesión. Todo intenta inferir algo sobre el cliente a partir de la forma del request.
El 1 de julio de 2026, Cloudflare cambió la pregunta. El tráfico de bots ahora se clasifica en tres categorías que no tienen nada que ver con la apariencia del request en la red. Search cubre los "crawlers que indexan tu contenido para poder responder preguntas sobre él más tarde". Agent cubre la "actividad automatizada que actúa en tiempo real en nombre de una persona". Training cubre los "crawlers que toman tu contenido para entrenar o ajustar un modelo".
Imagina tres requests que llegan al mismo servidor. Mismo cliente, mismos headers, mismos tiempos, idénticos hasta el último byte. Bajo este modelo pueden recibir tres veredictos diferentes, decididos completamente por lo que planeas hacer con la página después de que llegue.
Eso no es un mejor detector. Es una primitiva diferente.
La fecha límite del 15 de septiembre es más acotada que el pánico
La versión de esta historia que circula por los foros de desarrolladores es que Cloudflare bloqueará a los agentes de IA en una quinta parte de la web el 15 de septiembre.
El registro de cambios dice algo mucho más reducido. Los nuevos valores predeterminados se aplican a los "nuevos dominios que se incorporen a Cloudflare". En esos dominios, "los bots clasificados como Training o Agent se bloquean en las páginas que muestran anuncios, mientras que Search sigue estando permitido". Todos los que ya están en Cloudflare eligen su propia configuración, y pueden hacerlo en cualquier momento antes de la fecha.
En resumen: solo dominios nuevos, solo páginas con anuncios y una de las tres categorías sigue pasando de forma predeterminada. Es un cambio real, pero no es un muro que bloquee internet.
Sin embargo, el alcance reducido es la parte interesante. Cloudflare no publicó una política, publicó un valor predeterminado, y los valores predeterminados son la forma en que una política se convierte en la norma sin que nadie vote por ella. La cifra que vale la pena vigilar no es la del 15 de septiembre. Es cuántos de esos dominios nunca volverán a tocar esa configuración después.
Lo que esto significa: si recolectas datos, la pregunta útil dejó de ser "¿puedo superar la protección de este sitio?" y pasó a ser "¿en qué categoría cree este sitio que estoy?". Tienen respuestas distintas y solo una de ellas es algo que puedes probar.
El propósito no se puede medir. Tiene que declararse.
Este es el problema mecánico de clasificar el tráfico por intención: la intención no está en el paquete.
Una fingerprint se puede medir. El movimiento del ratón se puede medir. "Por qué estás solicitando esta página" no se puede medir, por lo que el sistema necesita que el cliente lo declare explícitamente y necesita un motivo para creer en la respuesta. Ese es el trabajo que realiza Web Bot Auth. El agente firma sus requests con una clave privada, publica un directorio de claves y el edge verifica la firma contra él, basado en RFC 9421 HTTP Message Signatures. La documentación de Cloudflare define el estándar para un bot verificado como "autoidentificación honesta".
Ahora observa qué está aplicando esto a escala. La especificación es draft-meunier-webbotauth-httpsig-protocol-02, revisada por última vez el 18 de agosto de 2026. Estado previsto: Standards Track. Estado real: un "Active Internet-Draft (individual)" que "no está respaldado por el IETF" y "no tiene reconocimiento formal en el proceso de estándares del IETF". Tiene dos autores. Uno trabaja en Cloudflare y el otro trabaja en Google.
Creemos que el diseño es correcto, y vale la pena decirlo antes de entrar en las críticas. La identidad firmada supera la carrera armamentista de los CAPTCHA para cualquiera que tenga intención de actuar correctamente. Un crawler que se identifica puede ser permitido, regulado o facturado a propósito en lugar de ser adivinado, y los propietarios de sitios obtienen un control que no afecta a los visitantes reales como daño colateral. Compara eso con una década de bloquear rangos de IP y esperar lo mejor.
Lo que no puede hacer es detener a nadie. Un sistema basado en el propósito declarado solo clasifica el tráfico que se declara a sí mismo. Todo lo demás vuelve al stack de detección que ya existía, y ese stack sigue perfeccionándose: el session-scoped behavioral scoring de Cloudflare se lanzó doce días después de las nuevas categorías.
Por lo tanto, ambos enfoques no compiten. La identidad clasifica a los honestos, la detección se encarga de todos los demás, y la segunda opción es donde termina tu tráfico por defecto si nunca declaras nada.
No hay una categoría para recopilar datos públicos
Ahora, la parte que debería preocupar a cualquiera que ejecute un pipeline de recolección de datos.
Toma el trabajo que hemos publicado este año. Un índice de precios de madera creado a partir de listados públicos. Detección de infracciones de MAP en seis marketplaces, lo que significa solicitar la misma página de producto desde seis puntos de vista diferentes y comparar lo que dice cada uno. Rankings de tiendas de aplicaciones y análisis de sentimiento en reseñas. Verificaciones de colocación de anuncios ejecutadas desde el país donde realmente se compró la campaña.
Clasifica esos casos en Search, Agent o Training.
Search no encaja: la propia definición de Cloudflare incluye la expectativa de "tráfico de referencia u otra compensación equitativa a cambio", y una comprobación nocturna de precios no envía referencias a nadie. Agent tampoco encaja, porque no hay ningún humano sentado frente a una pantalla esperando esa petición. Y Training es sencillamente incorrecto, ya que nada se absorbe en un modelo.
Esta es una taxonomía creada para describir el tráfico de IA que apareció en los últimos tres años, aplicada ahora a un sector que la precede por una década. Inteligencia de precios, datos alternativos, seguimiento de SERP, protección de marca, verificación de anuncios, monitorización de cumplimiento: nada de esto es nuevo, nada de esto es agéntico y nada de esto tiene una casilla para marcar.
El tráfico sin casilla lo clasifica quien dibujó las casillas. Por lo general, en la más cercana.
Qué significa esto para los equipos de datos
Cuatro acciones que vale la pena tomar mientras las reglas sigan siendo flexibles.
Decide qué categoría reclamarías honestamente. No la que te permita pasar la puerta. La que defenderías por escrito si un publisher te lo preguntara directamente. Si la respuesta honesta es "ninguna de estas", estás en el grupo con más que perder cuando la taxonomía se consolide, y con más que ganar si lo dices mientras todavía haya margen de debate.
Revisa la configuración del objetivo, no los titulares. La política de bots de un sitio es ahora una propiedad de ese sitio, configurable por ruta, y cambia sin previo aviso. Tratar "Cloudflare bloquea agentes en septiembre" como un hecho sobre tu pipeline te llevará a reconstruir cosas que nunca estuvieron en riesgo.
Asume que la prueba de páginas con anuncios se extenderá. Cloudflare vinculó su valor predeterminado a páginas que muestran anuncios, una aproximación razonable para "esta página monetiza la atención humana". Esa línea se moverá, y Cloudflare no es el único que la dibuja. AWS WAF lanzó AI traffic monetization el 15 de junio de 2026, respondiendo con un 402 y condiciones de pago legibles por máquina. Akamai optó por la vía de alianzas con TollBit y Skyfire. Tres de los mayores proveedores de edge venden ahora la misma superficie de control, la cual analizamos desde la perspectiva de precios when pay-per-crawl launched.
Mantén tu recolección capaz de operar en cualquier carril. El carril identificado (firmar, declarar, recibir autorización o ser facturado) y el no identificado (ser evaluado por comportamiento, como siempre) van a coexistir durante años. Desarrollar como si solo existiera uno de ellos es el error costoso aquí, en ambas direcciones.
Las casillas se van a rediseñar
Una predicción con la que nos comprometemos con gusto: aparecerá una cuarta categoría en menos de un año.
La primera versión de cualquier taxonomía la escribe quien está bajo presión, y las personas clasificadas no están en la sala cuando sucede. Search, Agent y Training describen lo que las empresas de IA hacen con los publishers. No describen a una firma de investigación de mercado, a un equipo de compliance ni a un retailer que verifica el precio de catálogo de un competidor, y esos tres han estado extrayendo páginas públicas de forma educada desde antes de que "agent" significara algo en este contexto.
La disputa sobre cómo se llama esa cuarta casilla, y quién puede marcarla, importará más a la industria de los datos que cualquier benchmark anti-bot publicado este año. Vale la pena presentarse a esa batalla.
Porque la alternativa por defecto es bastante simple. Si tu tráfico no puede nombrarse a sí mismo, alguien más lo nombrará por ti.