Todos los artículos

El pago por rastreo está dividiendo la web en dos

El mercado de pago por rastreo de Cloudflare y HTTP 402 dividen la web en datos licenciados y abiertos. Esto es lo que cambia para los equipos que recopilan datos web en 2026.

El 19 de febrero de 2026, Stack Overflow y Cloudflare hicieron público algo que la mayor parte de la industria de datos web no vio venir. Lanzaron conjuntamente el pago por rastreo: un sistema donde los crawlers de IA obtienen una respuesta 402 Payment Required en tiempo real y pueden pagar el precio del editor o irse. La identidad del bot se verifica en el edge, el sitio establece el precio, la transacción se mide.

Cloudflare se encuentra frente a aproximadamente uno de cada cinco sitios en Internet. Así que cuando activaron el bloqueo por defecto para bots de IA conocidos y crearon un mercado donde los editores cobran por request, el modelo de acceso para una gran parte de la web abierta cambió en un fin de semana.

Si estás desplegando infraestructura de datos web ahora mismo, este no es un anuncio de Cloudflare para archivar. Cambia los cálculos sobre lo que significa "abierto".

La mecánica detrás del cambio

El movimiento técnico es pequeño. Cloudflare resucitó HTTP 402, el código de estado "Payment Required" inactivo por mucho tiempo, y lo conectó a un registro de crawlers de IA verificados. Un editor establece un precio por request. El crawler tiene un saldo de crédito y paga, o es bloqueado.

El movimiento no técnico es mayor. Antes de esto, las únicas formas de imponer "no extraigas mi contenido para IA" eran robots.txt (consultivo, no forzado) y el bloqueo agresivo de bots (binario, con pérdidas y lleno de falsos positivos). Cloudflare añadió una tercera opción: una etiqueta de precio.

La economía de esa tercera opción funciona de manera diferente a las dos primeras. Robots.txt no cuesta nada y es ignorado. El bloqueo de bots te cuesta tráfico de usuarios reales mal clasificados como bots. Una etiqueta de precio, por diseño, separa los crawlers dispuestos a pagar de los que no lo están.

Quién está cobrando realmente

Stack Overflow fue el socio de lanzamiento porque sus datos de entrenamiento son genuinamente valiosos y ya estaban negociando acuerdos bilaterales con OpenAI y otros. El mercado de Cloudflare generalizó esos acuerdos bilaterales en un registro al que el resto del mundo editorial puede conectarse.

La lista de los que siguieron creció rápido. AWS lanzó su propia capa de monetización de bots. Akamai construyó una paralela. La propuesta para los editores es directa: en lugar de una costosa demanda contra un laboratorio de IA, obtén una línea de ingresos que paga por request.

Por ahora esto es principalmente el nivel de contenido de alto valor: documentación, noticias, preguntas y respuestas técnicas, datos de referencia estructurados. La larga cola de la web (pequeños sitios de ecommerce, listados regionales, foros de nicho) no se encuentra detrás de esa puerta y probablemente nunca lo hará. La propia gestión de bots de Cloudflare cuesta dinero de operar, y el pago por rastreo es opcional. Solo compensa a los sitios donde vale la pena cobrar por una sola vista de página.

Qué significa esto para los pipelines de datos web

Si estás construyendo un pipeline que extrae de Stack Overflow, sitios de noticias importantes o cualquiera de los editores que se están uniendo activamente, tus opciones se reducen a tres. Pagar a través del mercado una vez que tu tráfico sea identificable como un crawler de IA. Cambiar a un conjunto de datos licenciado donde exista uno. O encontrar los datos en algún lugar donde todavía estén abiertos.

La mayoría de los equipos terminarán haciendo las tres cosas en diferentes momentos. Esa es la realidad práctica. La web se está dividiendo en licenciada y abierta, y el límite no se traza limpiamente a lo largo de las líneas de dominio. El mismo editor puede tener una sección detrás de 402 y otra sección abierta. El mismo sitio puede cobrar a un crawler e ignorar a un bot de investigación por completo.

Creemos que la reacción práctica para los equipos de ingeniería se ve así. Primero, audita tus fuentes. Si una parte significativa de tu pipeline extrae de Stack Overflow, Reddit, sitios de noticias importantes o cualquiera de la docena de editores que visiblemente buscan estos acuerdos, asume que el modelo de acceso cambiará en doce meses. Segundo, separa las fuentes licenciadas de las abiertas dentro de tu arquitectura temprano. Un pipeline que trata a cada fuente de manera idéntica es frágil cuando la mitad de ellas comienzan a pedir dinero y la otra mitad no. Tercero, deja de tratar a robots.txt como la única señal. La respuesta 402 significará algo a nivel operativo incluso si tu crawler no es un agente de IA. Los falsos positivos son inevitables en un sistema tan nuevo.

Esto se sitúa junto a la presión de cumplimiento de datos de entrenamiento de la Ley de IA de la UE, que ya empujó a los equipos hacia fuentes con seguimiento de procedencia. El pago por rastreo es la misma presión con una capa de facturación adjunta.

La opinión honesta

Algunas cosas confundirán a la gente. La verificación de identidad de Cloudflare se basa en que los bots se registren. Los bots que no se registran, o que parecen tráfico residencial, no activan 402 en absoluto. En su lugar, chocan con el stack normal anti-bot. Ese ya es el camino que tomarán la mayoría de los crawlers de IA agresivos. Así que el pago por rastreo funciona para los bots que quieren cumplir. Los que no lo hacen, tampoco iban a respetar robots.txt.

El cambio mayor podría no ser el mercado en sí. Es que "¿está este contenido disponible para entrenamiento de IA?" se convirtió en una pregunta con una respuesta contractual en lugar de una suposición de robots.txt. Los editores finalmente pueden hacer cumplir. Los crawlers finalmente pueden saber. La zona gris se reduce donde llega el mercado.

Lo que se mantiene gris es todo lo que está fuera de él. El sitio pequeño sin Cloudflare, el agregador regional sin estrategia de IA, la larga cola de la web sobre la que nadie está negociando: esos no obtienen un 402, y tampoco obtienen un acuerdo de licencia. Mantienen cualquier política de acceso que tuvieran antes, solo que con protestas más fuertes ahora que hay un precedente de compensación.

Hacia dónde va esto

Dos predicciones, y no son seguras.

Uno: los próximos doce meses verán un segundo nivel de muro de pago, esta vez para bots que no son de IA. El mecanismo del mercado es solo un código de estado HTTP y una capa de facturación. No es técnicamente difícil de extender a precios para crawlers de búsqueda, precios para bots de archivo o precios para monitoreo de competidores. Si los editores mantienen la línea de cobrar solo a los crawlers de IA depende de cómo se comporte la próxima ola. La mayoría de los años, esa línea se rompe.

Dos: los laboratorios de IA lo esquivarán. No ignorando el 402 (eso es rastreable y judicializable), sino comprando conjuntos de datos licenciados a granel y luego ejecutando todo lo demás a través de tráfico que parece de usuarios reales. Cloudflare ya está implementando más detección de comportamiento precisamente porque saben esto. Hemos visto que la carrera armamentística cambia a señales a nivel de sesión durante dos años. No termina con un mercado.

La pregunta interesante para los desarrolladores no es si pagar. Es dónde la web abierta se mantiene abierta, y por cuánto tiempo.