← Tous les articles

L'EU AI Act met fin au libre-service des données d'entraînement

La collecte de données d'entraînement pour l'IA passe d'un problème technique à un problème de conformité. L'EU AI Act et la surveillance accrue des fournisseurs redéfinissent les règles d'ici 2027.

La fin du Far West pour les données d'entraînement IA

À la mi-2025, 75 % du trafic web lié à l'IA correspondait à la collecte de données d'entraînement (Cloudflare Radar via Bright Data, 2025). Pas de l'inférence. Pas de la recherche. De l'entraînement. Des crawlers récupérant des pages pour alimenter le modèle suivant.

Cette ère touche à sa fin.

Trois facteurs ont convergé au cours des six derniers mois. Les exigences de transparence de l'EU AI Act sont passées du statut de projet à celui de règles applicables. Les sites ont commencé à bloquer massivement les crawlers d'IA : 60 % des domaines réputés fin 2025, contre 23 % en septembre 2023 (Ars Technica, 2025). Et les acheteurs de données d'entraînement ont commencé à poser de nouvelles questions sur leur provenance.

Si vous développez un produit qui utilise des données scrapées pour entraîner des modèles, vous faites face à un problème que la plupart des équipes n'ont pas encore intégré dans leurs coûts.

Ce que l'EU AI Act exige réellement

Le déploiement de 2026 introduit des exigences de transparence sur les sources des données d'entraînement IA (Scalevise summary, 2026). Les fournisseurs de modèles d'IA à usage général doivent publier des résumés de ce qui a servi à les concevoir. Les auteurs et les ayants droit peuvent s'y opposer (opt-out), et cette opposition doit être respectée dès la phase de collecte de données, et non lors de l'entraînement du modèle (où il est déjà trop tard).

En pratique, trois critères apparaissent sur les listes de contrôle d'approvisionnement :

  • Des registres publics indiquant les sites scrapés, la date de collecte et les autorisations associées
  • Des mécanismes pour respecter le fichier robots.txt et les signaux explicites d'opt-out
  • Un lignage des données (data lineage) capable de résister à un audit dans deux ans

Mais il y a un piège : impossible d'ajouter la conformité après coup sur un pipeline incapable de tracer ce qu'il a extrait et d'où cela provient. Les équipes qui ont conçu leur scraping comme un simple projet secondaire vont vite réaliser que « projet secondaire » et « prêt pour l'audit » sont incompatibles.

En clair : la sélection des fournisseurs inclut désormais la question « votre partenaire de collecte de données peut-il fournir une piste d'audit claire ? ». Cette question ne figurait pas sur la plupart des checklists en 2024. Elle sera présente sur toutes les listes sérieuses d'ici le T3 2026.

La question des courtiers de données s'est complexifiée

Bright Data a déclaré plus de 300 millions de dollars de chiffre d'affaires annualisé avec une croissance supérieure à 50 % d'une année sur l'autre, et ils ont été explicites sur le fait que les données pour l'IA en constituent le principal moteur. Le marché des données d'entraînement conformes a explosé, car l'alternative (scraper n'importe quoi sans contrainte) est devenue plus risquée sur deux plans précis.

D'abord, la surface juridique s'est élargie. La Cour suprême a rejeté la requête en brevet de Bright Data en février 2026, et deux de leurs brevets sur les proxy résidentiels ont été invalidés. Oxylabs a riposté par une contre-attaque, avec un procès prévu pour le 18 mai 2026. Quel que soit votre avis sur le fond, le résultat est un litige coûteux sur la manière dont les données sont collectées. Les petits acteurs qui observent cela ne sont pas rassurés.

Ensuite, la surface technique s'est élargie. Les fournisseurs de détection de bots ont commencé à partager des renseignements sur les menaces entre les sites de leurs clients en temps réel. Un modèle de scraping signalé sur un site e-commerce peut être bloqué sur des centaines d'autres en quelques heures (SecurityBoulevard, 2026). L'ancienne méthode consistant à faire tourner des proxy bon marché en espérant que tout se passe bien a cessé de fonctionner vers la fin de 2025. Nous avons documenté cette évolution dans la détection de bots est devenue comportementale.

En résumé: le coût de la collecte interne de données d'entraînement a augmenté sur les deux plans. L'exposition juridique a grimpé. La difficulté technique a grimpé. Les entreprises qui continuent à le faire en interne dépensent des sommes importantes en infrastructure ou acceptent que leurs jeux de données ne survivront pas à un audit.

Où nous en serons d'ici mi-2027

Nous pensons que les 18 prochains mois vont remodeler le paysage des fournisseurs de trois manières.

La conformité devient un prérequis incontournable. ISO 27001, SOC 2, processus alignés sur le RGPD, traçabilité des données. Ce ne sont pas des facteurs de différenciation, mais des exigences minimales. Bright Data possède déjà ISO 27001 et SOC 2. La plupart de leurs concurrents tentent de rattraper leur retard. Les équipes qui déploient des produits IA sérieux refuseront d'intégrer un fournisseur de collecte de données incapable de fournir ces certificats.

Les pistes d'audit deviennent une fonctionnalité essentielle. La plupart des API de scraping actuelles renvoient des données et suppriment tout le reste. D'ici 2027, une part importante des clients voudra une trace: URL source, heure de récupération, code de réponse, statut du robots.txt au moment de la récupération, vérifications d'exclusion. Des métadonnées sans éclat qui deviennent une bouée de sauvetage en matière de conformité lorsqu'un modèle est contesté.

La consolidation des fournisseurs s'accélère. La charge de la conformité favorise l'échelle. Les petites API de scraping qui survivent grâce à des forfaits à 69 $/mois devront soit monter en gamme, soit être exclues de tout contrat lié à l'entraînement d'IA. Les fournisseurs intermédiaires qui allient conformité et tarification raisonnable récupéreront cette demande déplacée. Le calcul entre développement interne et achat que nous avons analysé le mois dernier vient de se dégrader pour l'option du développement interne.

Ce que cela implique pour les équipes d'ingénierie

Si vous déployez un produit IA au cours des 12 prochains mois, vos décisions d'approvisionnement en données ne relèvent plus uniquement de l'infrastructure. Elles relèvent du risque juridique et de l'accès au marché.

Trois questions à poser à votre pipeline actuel:

  1. Pouvez-vous lister chaque domaine crawlé au cours des 12 derniers mois, avec les horodatages ? Si ce n'est pas le cas, vous ne pouvez pas passer un audit de base.

  2. Respectez-vous les signaux d'opt-out au moment de la récupération (fetch), et non au moment de l'entraînement ? Robots.txt et X-Robots-Tag ne sont plus optionnels.

  3. Si votre fournisseur de données modifiait ses conditions demain, votre pipeline d'entraînement y survivrait-il ? La plupart des équipes ne se sont pas posé la question.

Vérifiez donc maintenant. Les premières demandes d'audit arrivent chez des entreprises qui pensaient avoir encore un an pour régler cela.

Notre point de vue

La conformité dès la conception (compliance-by-design) n'est pas un slogan marketing. C'est une décision de survie pour toute équipe dont le produit dépend des données web. Les équipes qui traitent la traçabilité des données (data lineage) comme une fonctionnalité P0 dès maintenant s'éviteront une panique brutale en 2027. Celles qui la traitent comme de la simple paperasse découvriront, tôt ou tard, que cette paperasse est précisément ce qui sépare leur produit de son marché.

Le Far West des données d'entraînement ne prend pas fin parce que les régulateurs sont vindicatifs. Il prend fin parce que les conséquences d'une erreur sont passées d'un « article de blog embarrassant » à « vous ne pouvez plus déployer en Europe ». Cela change l'équation pour tous les acteurs de la chaîne de valeur.