Une vérification de bot, deux tribunaux, deux réponses opposées
À onze jours d'intervalle cet été, deux juges fédéraux ont examiné la même vérification de bot Google, le même défendeur et le même type de réclamation. Leurs conclusions sont diamétralement opposées.
Le 20 juillet 2026, la juge en chef Yvonne Gonzalez Rogers du Northern District of California a rejeté les réclamations DMCA de Google contre SerpApi, l'entreprise qui vend des résultats Google via une API. Le 31 juillet, le juge Paul Engelmayer du Southern District of New York a principalement rejeté les requêtes de non-lieu déposées par SerpApi et Perplexity dans le cadre du procès intenté par Reddit, qui repose sur le même système Google.
| Affaire | Tribunal | Décision | Réclamations DMCA |
|---|---|---|---|
| Google v. SerpApi | N.D. California | 20 juillet 2026 | Rejetées |
| Reddit v. SerpApi | S.D. New York | 31 juillet 2026 | Majoritairement maintenues |
Le procès opposant Google à SerpApi a fait les gros titres, et la majorité de la couverture médiatique a interprété le mois de juillet comme une victoire et une défaite pour les scrapers. Notre lecture est différente. Contourner le contrôle n'est pas ce qui a déterminé l'issue de ces deux affaires. Ce qui se trouvait derrière ce contrôle, et l'entité qui en détient les droits, a fait toute la différence. Pour quiconque collecte des données web, c'est une règle bien plus utile que les gros titres.
À quoi ressemble SearchGuard vu du côté client
SearchGuard est le challenge JavaScript mis en place par Google devant son moteur de recherche en janvier 2025. Selon Google, une requête provenant d'une source non reconnue reçoit du code à exécuter. Le navigateur d'un utilisateur y répond de manière totalement transparente; la plupart des clients automatisés en sont incapables et se voient refuser l'accès.
Nous y sommes nous-mêmes confrontés. Lors de tests réalisés le 17 septembre 2026, Google Search a répondu à certaines requêtes automatisées par une page de 92 Ko intitulée simplement "Google Search": HTTP 200, aucun résultat, et une invite demandant d'activer JavaScript. Le sas de protection de Reddit présente un comportement réseau similaire (un code 200 intitulé "Reddit - Prove your humanity"). Tout système évaluant le succès d'une requête uniquement d'après le code d'état enregistre les deux comme des pages livrées avec succès.
Voici l'élément clé omis par les médias. La juge Gonzalez Rogers n'a pas conclu que SerpApi n'avait pas contourné SearchGuard. Elle a considéré que Google avait suffisamment caractérisé une violation de la Section 1201 du DMCA, et elle a rejeté l'argument de SerpApi selon lequel Google, n'étant pas propriétaire des contenus, ne pouvait pas intenter d'action. Google a tout de même perdu.
Ce que cela implique: les tribunaux ne considèrent pas la question "avez-vous franchi le contrôle?" comme l'élément déterminant. Ils la considèrent simplement comme le point de départ de l'analyse.
Pourquoi Google a perdu et Reddit non
La section 1201 du DMCA interdit le contournement d'une mesure contrôlant l'accès à « une œuvre protégée en vertu du présent titre », c'est-à-dire une œuvre protégée par le droit d'auteur. La plainte même de Google décrivait ses résultats comme des compilations d'informations publiques, avec des Knowledge Panels pouvant « contenir certains contenus protégés par le droit d'auteur ». L'ordonnance a pris Google au mot : « Dans la mesure où les résultats de Google Search ne contiennent aucun contenu protégé par le droit d'auteur, on ne peut considérer que SearchGuard contrôle efficacement l'accès à une œuvre protégée par le Copyright Act. » Ce volet de l'affaire a été rejeté sans possibilité de modification.
Le volet concernant les Knowledge Panels a échoué sur un second point. La mesure doit fonctionner « avec l'autorisation du titulaire du droit d'auteur », et Google n'avait invoqué aucune condition des licences associées à ces images. Google gère le portail d'accès. Il ne possède pas la majorité de ce qui se trouve derrière.
La situation de Reddit est différente. Les publications de ses utilisateurs sont protégées par le droit d'auteur, et ses conditions d'utilisation accordent à Reddit une licence sur l'ensemble de ces contenus. Le juge Engelmayer a validé les requêtes au titre de la section 1201(a)(1)(A) contre les deux défendeurs et au titre de la section 1201(a)(2) contre SerpApi, tout en rejetant une requête 1201(b) ainsi que les chefs d'accusation d'enrichissement sans cause et de concurrence déloyale relevant du droit de l'État. Même critère, mais ce plaignant détenait des droits sur le contenu qu'il protégeait. Le tribunal a toutefois laissé ouverte la question de savoir si les courts extraits apparaissant sur les pages de Google sont protégés, et Oxylabs, également visé par la plainte, a toujours sa propre motion de non-lieu en attente.
La licence devient le verrou
Google a compris le message. Sa plainte modifiée, déposée le 10 août, reconstruit le dossier autour des contrats. Elle affirme que les concédants de licence ont autorisé les contrôles d'accès « et, dans certains cas, ont insisté pour que Google les mette en place ». Elle précise qu'un partenaire non nommé oblige Google depuis 2017 à « déployer des efforts commercialement raisonnables pour protéger le contenu sous licence contre tout accès non autorisé de tiers », et que l'accord avec Reddit « enjoint à Google de ne pas permettre à des tiers d'extraire et de commercialiser de manière indépendante le contenu sous licence ». Elle invoque même les propres règles de confidentialité de Google comme une autorisation accordée par les utilisateurs.
La seconde motion de non-lieu de SerpApi réplique qu'aucun de ces accords n'a été effectivement soumis au tribunal, et qu'« une clause interdisant le téléchargement n'est pas une clause interdisant l'accès ». Le 15 septembre, le juge a rejeté la demande de SerpApi visant à contraindre Google à produire les licences. L'audience sur la motion elle-même est fixée au 13 octobre 2026, d'après le registre de la procédure.
Nous pensons que la décision d'octobre importe moins que la stratégie qu'elle a déjà définie. Une clause imposant à un titulaire de licence de protéger le contenu contre les accès non autorisés était autrefois une formalité standard. Après cet été, c'est l'élément déterminant pour une demande de dommages-intérêts légaux de 200 $ à 2 500 $ par infraction. Attendez-vous donc à ce que chaque accord de contenu signé désormais en comporte une, y compris les accords d'accès payant qui ont commencé à émerger autour du pay-per-crawl.
Les comptes n'ont jamais été la question en suspens
Un aspect de cette affaire n'a pas bougé du tout. À la mi-septembre, un juge fédéral de Californie a finalisé un jugement sur consentement entre LinkedIn et ProAPIs, ainsi que son partenaire Netswift : arrêter le scraping, arrêter de vendre ou de transférer les données, arrêter d'utiliser de faux comptes, supprimer ce qui a été extrait. La plainte de LinkedIn décrivait des millions de faux comptes, avec des centaines ou des milliers créés chaque jour.
Ces allégations se concentraient sur les comptes, pas sur le contournement d'un contrôle. Et le résultat a été radical : aucun accès, aucune revente, aucune donnée.
Ce que cela signifie pour les équipes de données
Nous sommes des ingénieurs, pas des juristes, et les deux décisions de juillet sont intervenues au stade de la motion de non-lieu plutôt qu'au procès. Lisez ce qui suit comme une cartographie de l'orientation des débats, et soumettez les questions de fond à votre service juridique.
- Triez vos cibles selon ce que vous conservez. Les prix, les niveaux de stock, les classements, les liens et les listes sont des faits. Les publications, les avis, les articles, les photos et les paroles sont de l'expression. La partie permanente de l'ordonnance du 20 juillet couvre la première catégorie ; le cas Reddit concerne la seconde.
- L'itinéraire ne blanchit pas le contenu. Les réclamations de Reddit encore retenues concernent des publications prétendument extraites des pages de résultats de Google, et non de reddit.com. Récupérer du contenu utilisateur via un intermédiaire de recherche transmet également les revendications du propriétaire.
- Le contrôle opéré par le propriétaire lui-même constitue le dossier solide. La faiblesse de Google était d'administrer un verrou sur le travail d'autrui. Un éditeur qui possède ses articles et a acheté un produit anti-bot pour les protéger ne partage pas cette faiblesse, et selon l'étude State of Web Access 2026 de Zyte, 18,5 % des principaux sites exécutent un service dédié de détection des bots, chacun par choix délibéré.
- Comptez les connexions. Si une étape quelconque de votre pipeline utilise une authentification, c'est là que se concentre votre exposition, indépendamment de ce que les tribunaux finiront par statuer sur les vérifications de bots.
- Prévoyez un budget pour les frictions qu'aucun tribunal ne supprimera. Google a confirmé le 26 août que les liens de résultats passent désormais par une redirection google.com/goto. Derek Perkins de Nozzle a signalé que les liens ne peuvent pas être décodés localement et que la résolution d'un classement de cinq pages nécessite 500 à 1 000 requêtes. Ajoutez à cela la suppression du paramètre num=100 en septembre 2025 (l'impact que cela a eu sur le suivi des classements) et les données de recherche sont devenues deux fois plus coûteuses, sans la moindre intervention judiciaire.
Du code aux contrats
Pendant des années, le débat sur le scraping portait sur la question de savoir si un contrôle anti-bot constitue un verrou. La réponse apportée cet été est plus tranchée qu'un simple oui ou non : c'est le cas lorsque le verrou appartient au propriétaire du contenu protégé, ou à une personne qu'il a autorisée par écrit.
Cela déplace le combat du domaine de l'ingénierie vers les services juridiques et de licences. Ajoutez à cela l'initiative de Cloudflare visant à trier le trafic de bots selon l'objectif déclaré, et la tendance semble confirmée : l'accès dépend désormais de votre identité et des accords que vous avez signés, et de moins en moins de la structure de vos requêtes.
Si vous collectez des données publiques factuelles, le mois de juillet a clarifié votre situation. Si vous collectez le contenu rédactionnel d'autrui à travers le portail d'un tiers, votre position devient beaucoup plus difficile à défendre.