El libre albedrío en los datos de entrenamiento para IA está terminando
A mediados de 2025, el 75% del tráfico web relacionado con IA correspondía a la recopilación de datos de entrenamiento (Cloudflare Radar a través de Bright Data, 2025). No inferencia. No búsqueda. Entrenamiento. Crawlers extrayendo páginas para alimentar el siguiente modelo.
Esa era está llegando a su fin.
Tres factores convergieron en los últimos seis meses. Los requisitos de transparencia de la EU AI Act pasaron de estar en borrador a ser exigibles. Los sitios comenzaron a bloquear crawlers de IA a gran escala: el 60% de los dominios con buena reputación a finales de 2025, frente al 23% en septiembre de 2023 (Ars Technica, 2025). Y los compradores de datos de entrenamiento empezaron a hacer nuevas preguntas sobre su procedencia.
Si estás creando un producto que utiliza datos extraídos mediante scraping para entrenar modelos, tienes un problema que la mayoría de los equipos aún no ha presupuestado.
Lo que realmente exige la EU AI Act
El despliegue de 2026 introduce requisitos de transparencia para las fuentes de datos de entrenamiento de IA (resumen de Scalevise, 2026). Los proveedores de modelos de IA de uso general deben publicar resúmenes de lo que se utilizó para entrenarlos. Los autores y titulares de derechos pueden excluirse (opt-out), y esa exclusión debe respetarse en la capa de recopilación de datos, no en la capa de entrenamiento del modelo (donde ya es demasiado tarde).
En la práctica, aparecen tres aspectos en las listas de verificación de compras:
- Registros públicos de qué sitios rastreaste, cuándo y bajo qué permisos
- Mecanismos para respetar robots.txt y señales explícitas de opt-out
- Linaje de datos que resista una auditoría dentro de dos años
Pero aquí está el truco: no puedes incorporar el cumplimiento normativo a un pipeline que no sabe qué extrajo ni de dónde. Los equipos que implementaron scraping como un proyecto secundario están a punto de descubrir que "proyecto secundario" y "listo para auditoría" son mutuamente excluyentes.
En otras palabras: la selección de proveedores ahora incluye la pregunta "¿puede tu socio de recopilación de datos generar un registro de auditoría limpio?". Esa pregunta no estaba en la mayoría de las listas de verificación en 2024. Estará en todas las listas serias para el tercer trimestre de 2026.
El dilema de los intermediarios de datos se volvió más complejo
Bright Data reportó ingresos anualizados de más de $300M con un crecimiento interanual superior al 50%, y han sido explícitos en que los datos para IA son el motor que lo impulsa. El mercado de datos de entrenamiento compatibles con la normativa explotó porque la alternativa (simplemente extraer lo que quieras) se volvió más riesgosa en dos aspectos específicos.
Primero, la superficie legal se amplió. La Corte Suprema rechazó la petición de patente de Bright Data en febrero de 2026, y dos de sus patentes de proxy residencial fueron invalidadas. Oxylabs presentó una contrademanda, con el juicio fijado para el 18 de mayo de 2026. Sin importar lo que pienses sobre los méritos, el resultado es un litigio costoso sobre cómo se recopilan los datos. Los actores más pequeños que observan esto no están tranquilos.
Segundo, la superficie técnica se amplió. Los proveedores de detección de bots comenzaron a compartir inteligencia de amenazas entre los sitios de sus clientes en tiempo real. Un patrón de scraping marcado en un sitio de comercio electrónico puede ser bloqueado en cientos de otros en cuestión de horas (SecurityBoulevard, 2026). La vieja táctica de rotar proxies baratos y esperar lo mejor dejó de funcionar a finales de 2025. Analizamos ese cambio en la detección de bots se volvió conductual.
En resumen: el costo de recopilar datos de entrenamiento por cuenta propia aumentó en ambos frentes. El riesgo legal subió. La dificultad técnica subió. Las empresas que todavía lo hacen están gastando dinero real en infraestructura o aceptando que sus conjuntos de datos no sobrevivirán a una auditoría.
Hacia dónde va esto a mediados de 2027
Creemos que los próximos 18 meses transformarán el panorama de proveedores de tres maneras.
El cumplimiento se vuelve un requisito básico. ISO 27001, SOC 2, procesos alineados con GDPR, trazabilidad de datos. Ya no son diferenciadores, son requisitos mínimos. Bright Data ya cuenta con ISO 27001 y SOC 2. La mayoría de sus competidores intentan ponerse al día rápidamente. Los equipos que lanzan productos serios de IA se negarán a incorporar un proveedor de recopilación de datos que no pueda presentar los certificados.
Los registros de auditoría se convierten en una funcionalidad clave. La mayoría de las API de scraping hoy en día devuelven datos y descartan todo lo demás. Para 2027, una parte significativa de los clientes exigirá un registro: URL de origen, hora de obtención, código de respuesta, estado de robots.txt al momento de la consulta, verificaciones de exclusión. Metadatos aburridos que se convierten en un salvavidas de cumplimiento si un modelo es cuestionado.
La consolidación de proveedores se acelera. La carga operativa de cumplimiento favorece la escala. Las pequeñas API de scraping que sobreviven con planes de $69/mes tendrán que apuntar a clientes de mayor tamaño o quedarán fuera de cualquier acuerdo relacionado con el entrenamiento de IA. Los proveedores medianos que combinen cumplimiento con precios razonables captarán la demanda desplazada. El cálculo de construir frente a comprar que analizamos el mes pasado acaba de empeorar para la opción de construir.
Qué significa esto para los equipos de ingeniería
Si vas a lanzar un producto de IA en los próximos 12 meses, tus decisiones sobre la obtención de datos ya no son solo un problema de infraestructura. Son una cuestión de riesgo legal y de acceso al mercado.
Tres preguntas para hacerte sobre tu pipeline actual:
¿Puedes listar cada dominio que has rastreado en los últimos 12 meses, con marcas de tiempo? Si no, no puedes pasar una auditoría básica.
¿Respetas las señales de exclusión al momento de la extracción y no durante el entrenamiento? Robots.txt y X-Robots-Tag ya no son opcionales.
Si tu proveedor de datos cambiara sus términos mañana, ¿sobreviviría tu pipeline de entrenamiento? La mayoría de los equipos no se lo han preguntado.
Así que revísalo ahora. Las primeras solicitudes de auditoría están llegando a empresas que creían tener otro año más para resolver esto.
Nuestra postura
El cumplimiento por diseño no es un eslogan de marketing. Es una decisión de supervivencia para cualquier equipo cuyo producto dependa de datos web. Los equipos que traten el linaje de datos como una funcionalidad P0 ahora se ahorrarán una carrera caótica en 2027. Los equipos que lo traten como simple papeleo descubrirán, con el tiempo, que ese papeleo es lo que se interpone entre su producto y el mercado.
El descontrol en los datos de entrenamiento no se termina porque los reguladores sean vengativos. Se termina porque las consecuencias de equivocarse pasaron de "un artículo vergonzoso en un blog" a "no puedes operar en Europa". Eso cambia los cálculos para todos en la cadena de suministro.