La web está clasificando bots por propósito, no por comportamiento
Todos los sistemas de detección de bots desarrollados en los últimos quince años hacen una sola pregunta: ¿este tráfico parece automatizado? Orden de cabeceras, huellas digitales a nivel de red, movimiento del ratón, tiempos de sesión. Todo intenta inferir algo sobre el cliente a partir de la estructura del request.
El 1 de julio de 2026, Cloudflare cambió la pregunta. El tráfico de bots ahora se divide en tres categorías que no tienen nada que ver con la apariencia de un request en la red. Search cubre "crawlers que indexan tu contenido para responder preguntas sobre él más adelante". Agent cubre "actividad automatizada que actúa en tiempo real en nombre de una persona". Training cubre "crawlers que toman tu contenido para entrenar o ajustar un modelo".
Imagina tres requests llegando al mismo servidor. Mismo cliente, mismos headers, mismos tiempos, idénticos hasta el último byte. Bajo este modelo pueden recibir tres veredictos diferentes, determinados enteramente por lo que planeas hacer con la página después de recibirla.
No es un detector mejor. Es una primitiva diferente.
La fecha límite del 15 de septiembre es más acotada que el pánico
La versión de esta historia que circula en los foros de desarrolladores dice que Cloudflare bloqueará agentes de IA en una quinta parte de la web el 15 de septiembre.
El registro de cambios dice algo mucho más reducido. Los nuevos valores predeterminados se aplican a "nuevos dominios que se incorporen a Cloudflare". En esos dominios, "los bots clasificados como Training o como Agent se bloquean en páginas que muestran anuncios, mientras que Search sigue permitido". Todos los que ya están en Cloudflare eligen su propia configuración y pueden hacerlo en cualquier momento antes de la fecha.
Por lo tanto: solo dominios nuevos, solo páginas con anuncios, y una de las tres categorías aún pasa por defecto. Es un cambio real, pero no es un muro a lo largo de internet.
Pero el alcance reducido es la parte interesante. Cloudflare no publicó una política, publicó un valor por defecto, y los valores por defecto son la forma en que una política se convierte en la norma sin que nadie vote por ella. El dato que vale la pena seguir no es el 15 de septiembre. Es cuántos de esos dominios nunca modificarán esa configuración después.
Lo que esto significa: si recolectas datos, la pregunta útil dejó de ser "¿puedo superar la protección de este sitio?" y pasó a ser "¿en qué categoría cree este sitio que estoy?". Tienen respuestas distintas y solo una de ellas es algo que puedes probar.
El propósito no se puede medir. Tiene que declararse.
Aquí está el problema mecánico de clasificar el tráfico por intención: la intención no está en el paquete.
Un fingerprint se puede medir. El movimiento del mouse se puede medir. «Por qué estás solicitando esta página» no se puede, por lo que el sistema necesita que el cliente lo diga en voz alta y necesita un motivo para creer en la respuesta. Ese es el trabajo de Web Bot Auth. El agente firma sus requests con una clave privada, publica un directorio de claves y el edge verifica la firma contra este, construido sobre RFC 9421 HTTP Message Signatures. La documentación de Cloudflare define el estándar para un bot verificado como «autoidentificación honesta».
Ahora observa qué está aplicando esto a escala. La especificación es draft-meunier-webbotauth-httpsig-protocol-02, revisada por última vez el 18 de agosto de 2026. Estado previsto: Standards Track. Estado real: un «Active Internet-Draft (individual)» que «no está respaldado por la IETF» y no tiene «ninguna validez formal en el proceso de estándares de la IETF». Tiene dos autores. Uno trabaja en Cloudflare y el otro trabaja en Google.
Creemos que el diseño es correcto, y vale la pena decirlo antes de que lleguen las críticas. La identidad firmada supera la carrera armamentista de las páginas de verificación para cualquiera que tenga la intención de comportarse bien. Un crawler que se identifica puede permitirse, limitarse con rate limits o facturarse deliberadamente en lugar de adivinar sus intenciones, y los propietarios de sitios obtienen un control que no afecta a los visitantes reales como daño colateral. Compara eso con una década de bloquear rangos de IP y esperar lo mejor.
Lo que no puede hacer es detener a nadie. Un sistema basado en el propósito declarado solo clasifica el tráfico que se declara a sí mismo. Todo lo demás vuelve al stack de detección que ya existía, y ese stack se vuelve cada vez más preciso: el session-scoped behavioral scoring de Cloudflare se lanzó doce días después de las nuevas categorías.
Por lo tanto, ambos enfoques no compiten. La identidad clasifica a los honestos, la detección maneja a todos los demás, y la segunda es donde tu tráfico termina por defecto si nunca declaras nada.
No hay una categoría para recopilar datos públicos
Ahora la parte que debería preocupar a cualquiera que opere un pipeline de recolección.
Toma el trabajo que hemos publicado este año. Un índice de precios de madera construido a partir de listados públicos. Detección de infracciones de MAP en seis marketplaces, lo que significa solicitar la misma página de producto desde seis puntos de observación diferentes y comparar lo que dice cada uno. Rankings de tiendas de aplicaciones y análisis de sentimiento en reseñas. Verificaciones de colocación de anuncios ejecutadas desde el país donde realmente se compró la campaña.
Clasifica eso en Search, Agent o Training.
Search no encaja: la propia definición de Cloudflare exige una expectativa de "tráfico de referencia u otra compensación equitativa a cambio", y una verificación nocturna de precios no envía referencias a nadie. Agent tampoco encaja, porque no hay ningún humano sentado frente a una pantalla esperando esa extracción. Y Training es directamente incorrecto, ya que nada se absorbe en un modelo.
Esta es una taxonomía redactada para describir el tráfico de IA que apareció en los últimos tres años, aplicada ahora a un negocio que la precede por una década. Inteligencia de precios, datos alternativos, seguimiento de SERP, protección de marca, verificación de anuncios, monitorización de cumplimiento: nada de esto es nuevo, nada de esto es agéntico y nada de esto tiene una casilla para marcar.
El tráfico que no tiene casilla es clasificado por quien diseñó las casillas. Por lo general, en la más cercana.
Qué significa esto para los equipos de datos
Cuatro cosas que vale la pena hacer mientras las reglas sigan siendo flexibles.
Decide qué categoría reclamarías honestamente. No la que te permita entrar. La que defenderías por escrito si un publisher te lo preguntara directamente. Si la respuesta honesta es "ninguna de estas", estás en el grupo que más tiene que perder cuando la taxonomía se consolide, y el que más tiene que ganar si lo expresa mientras aún haya espacio para el debate.
Revisa la configuración del objetivo, no los titulares. La política de bots de un sitio es ahora una propiedad de ese sitio, configurable por ruta, y cambia sin previo aviso. Tratar "Cloudflare bloquea agentes en septiembre" como un hecho definitivo sobre tu pipeline te llevará a reconstruir cosas que nunca estuvieron en riesgo.
Asume que el criterio de las páginas con anuncios se extenderá. Cloudflare vinculó su opción predeterminada a las páginas que muestran anuncios, una aproximación razonable para "esta página monetiza la atención humana". Ese límite se moverá, y Cloudflare no es el único que lo define. AWS WAF lanzó la monetización de tráfico de IA el 15 de junio de 2026, respondiendo con un 402 y términos de pago legibles por máquina. Akamai optó por asociarse con TollBit y Skyfire. Tres de los mayores proveedores de edge venden ahora la misma superficie de control, que analizamos desde la perspectiva de precios cuando se lanzó el pago por rastreo.
Mantén tu recolección capaz de operar en ambas vías. La vía identificada (firmar, declarar, recibir autorización o ser facturado) y la vía no identificada (ser evaluado según el comportamiento, como siempre) coexistirán durante años. Diseñar tu infraestructura como si solo existiera una de ellas es el error costoso aquí, en ambas direcciones.
Las casillas se van a rediseñar
Una predicción que sostenemos con total seguridad: aparecerá una cuarta categoría dentro de un año.
La primera versión de cualquier taxonomía la escribe quien está bajo presión, y las personas clasificadas no están en la sala cuando ocurre. Search, Agent y Training describen lo que las empresas de IA hacen con los editores. No describen a una firma de investigación de mercado, a un equipo de cumplimiento o a un minorista que consulta el precio de la competencia en el anaquel, y esos tres han estado extrayendo páginas públicas de forma educada desde antes de que "agent" significara algo en este contexto.
La disputa sobre cómo se llamará esa cuarta casilla, y quién podrá marcarla, importará más a la industria de datos que cualquier benchmark de detección de bots publicado este año. Vale la pena presentarse a esa batalla.
Porque la alternativa es bastante simple. Si tu tráfico no puede definirse a sí mismo, alguien más lo definirá por ti.