El 19 de febrero de 2026, Stack Overflow y Cloudflare hicieron público algo que la mayor parte de la industria de datos web no vio venir. Lanzaron conjuntamente pay-per-crawl: un sistema donde los crawlers de IA reciben una respuesta 402 Payment Required en tiempo real y pueden pagar el precio fijado por el publisher o retirarse. La identidad del bot se verifica en el edge, el sitio define el precio y la transacción se mide por uso.
Cloudflare está delante de aproximadamente uno de cada cinco sitios en internet. Así que cuando activaron el bloqueo por defecto para bots de IA conocidos y levantaron un marketplace donde los publishers cobran por request, el modelo de acceso para una gran parte de la web abierta cambió en un fin de semana.
Si estás implementando infraestructura de datos web en este momento, este no es un anuncio de Cloudflare para archivar. Cambia el cálculo sobre lo que significa "abierto".
La mecánica detrás del cambio
El movimiento técnico es pequeño. Cloudflare revivió HTTP 402, el código de estado "Payment Required" inactivo durante mucho tiempo, y lo conectó a un registro de crawlers de IA verificados. Un publisher define un precio por request. El crawler mantiene un balance de crédito y paga, o es bloqueado.
El movimiento no técnico es mayor. Antes de esto, las únicas formas de aplicar "no hagas scraping de mi contenido para IA" eran robots.txt (consultivo, no vinculante) y el bloqueo agresivo de bots (binario, con pérdidas y lleno de falsos positivos). Cloudflare añadió una tercera opción: una etiqueta de precio.
La economía de esa tercera opción funciona de forma diferente a las dos primeras. Robots.txt no cuesta nada y se ignora. El bloqueo de bots te cuesta tráfico de usuarios reales clasificados erróneamente como bots. Una etiqueta de precio, por diseño, separa a los crawlers dispuestos a pagar de los que no.
Quién está cobrando realmente
Stack Overflow fue el socio de lanzamiento porque sus datos de entrenamiento son genuinamente valiosos y ya estaban negociando acuerdos bilaterales con OpenAI y otros. El marketplace de Cloudflare generalizó esos acuerdos bilaterales en un registro al que el resto del mundo de publishers puede conectarse.
La lista de quienes siguieron creció rápido. AWS lanzó su propia capa de monetización de bots. Akamai construyó una paralela. La propuesta para los publishers es directa: en lugar de una demanda costosa contra un laboratorio de IA, obtén una línea de ingresos que paga por request.
Por ahora, esto abarca principalmente el nivel de contenido de alto valor: documentación, noticias, preguntas y respuestas técnicas, datos de referencia estructurados. La cola larga de la web (sitios pequeños de ecommerce, listados regionales, foros de nicho) no tiene tal barrera y probablemente nunca la tendrá. La gestión de bots de Cloudflare cuesta dinero y pay-per-crawl es opcional. Solo compensa para sitios donde vale la pena cobrar por una sola visualización de página.
Qué significa esto para los pipelines de datos web
Si estás construyendo un pipeline que extrae datos de Stack Overflow, medios de noticias importantes o cualquiera de los editores en proceso de integración, tus opciones se reducen a tres. Pagar mediante el marketplace en cuanto tu tráfico sea identificable como un crawler de IA. Cambiar a un dataset con licencia donde exista. O buscar los datos en algún lugar donde sigan siendo abiertos.
La mayoría de los equipos terminarán haciendo las tres cosas en diferentes momentos. Esa es la realidad práctica. La web se está dividiendo en contenido con licencia y abierto, y el límite no sigue claramente las líneas de los dominios. El mismo editor puede tener una sección tras un código 402 y otra sección abierta. El mismo sitio puede cobrar a un crawler e ignorar por completo a un bot de investigación.
Creemos que la reacción práctica para los equipos de ingeniería es la siguiente. Primero, audita tus fuentes. Si una parte significativa de tu pipeline extrae datos de Stack Overflow, Reddit, medios de noticias principales o cualquiera de la docena de editores que buscan activamente estos acuerdos, asume que el modelo de acceso cambiará en un plazo de doce meses. Segundo, separa las fuentes con licencia de las abiertas dentro de tu arquitectura desde el principio. Un pipeline que procesa cada fuente de manera idéntica es frágil cuando la mitad empieza a cobrar y la otra mitad no. Tercero, deja de considerar robots.txt como la única señal. La respuesta 402 tendrá un impacto operativo incluso si tu crawler no es un agente de IA. Los falsos positivos son inevitables en un sistema tan nuevo.
Esto se suma a la presión de cumplimiento para datos de entrenamiento por la Ley de IA de la UE, que ya empujó a los equipos hacia fuentes con trazabilidad de origen. El pago por rastreo es esa misma presión con una capa de facturación añadida.
La visión realista
Hay varios puntos que generarán tropiezos. La verificación de identidad de Cloudflare se basa en que los bots se registren. Los bots que no se registran, o que parecen tráfico residencial, no activan el 402 en absoluto. En su lugar, se topan con la detección de bots habitual. Esa es la vía que tomarán los crawlers de IA más agresivos. Por lo tanto, el pago por rastreo funciona para los bots que quieren cumplir. Los que no quieren, de todos modos nunca iban a respetar robots.txt.
El cambio más importante tal vez no sea el marketplace en sí. Es que responder a "¿está este contenido disponible para entrenamiento de IA?" pasó de ser una suposición basada en robots.txt a una respuesta contractual. Los editores por fin pueden hacer cumplir sus reglas. Los crawlers por fin tienen certeza. La zona gris se reduce allí donde llega el marketplace.
Lo que sigue siendo una zona gris es todo lo que queda fuera. El sitio pequeño sin Cloudflare, el agregador regional sin estrategia de IA, la larga cola de la web con la que nadie negocia: esos no implementan un 402 ni consiguen un acuerdo de licencias. Mantienen la política de acceso que tenían antes, solo que con quejas más visibles ahora que existe un precedente de compensación.
Hacia dónde va esto
Dos predicciones, y no son conservadoras.
Uno: los próximos doce meses verán un segundo nivel de paywall, esta vez para bots que no son de IA. El mecanismo de marketplace es solo un código de estado HTTP y una capa de facturación. No es técnicamente difícil extenderlo a precios para rastreadores de búsqueda, bots de archivo o monitorización de competidores. Que los editores mantengan el límite de cobrar únicamente a los rastreadores de IA depende de cómo se comporte la próxima ola. La mayoría de los años, ese límite se rompe.
Dos: los laboratorios de IA encontrarán formas de eludirlo. No ignorando el 402 (eso es rastreable y sujeto a litigios), sino comprando conjuntos de datos con licencia al por mayor y luego pasando todo lo demás a través de tráfico que parece de usuarios reales. Cloudflare ya está lanzando más detección de comportamiento precisamente porque lo sabe. Hemos visto esa carrera armamentista desplazarse hacia señales a nivel de sesión durante dos años. No termina con un marketplace.
La pregunta interesante para los desarrolladores no es si pagar. Es en qué lugares la web abierta sigue siendo abierta, y por cuánto tiempo.