Le web scraping se consolide. Voici ce qui change.
Oxylabs a levé 130 M$ pour une valorisation de 3,6 Md$. Bright Data a franchi les 300 M$ d'ARR. L'API de web scraping de milieu de gamme disparaît rapidement. Posez-vous ces cinq questions.
Oxylabs a levé 130 M$ pour une valorisation de 3,6 Md$. Bright Data a franchi les 300 M$ d'ARR. L'API de web scraping de milieu de gamme disparaît rapidement. Posez-vous ces cinq questions.
Les détecteurs ont creusé l'écart entre les sessions headless et normales en 2026. Si vous exécutez Puppeteer ou Playwright en production, anticipez le coût de la détection.
Cloudflare a déployé Precursor le 13 juillet. La détection comportementale à l'échelle de la session signifie que rafraîchir la page ne réinitialise plus votre score de bot. Pourquoi c'est important.
La place de marché pay-per-crawl de Cloudflare et le code HTTP 402 divisent le web entre données sous licence et données ouvertes. Voici ce qui change pour les équipes qui collectent des données web en 2026.
Firecrawl facture 5 fois plus pour extraire une page via LLM que pour la scraper. À 100 000 pages par jour, l'équation s'effondre. Quand l'extraction par LLM vaut-elle son coût, et quand ne le vaut-elle pas ?
Les fournisseurs affichent 400 millions d'IP résidentielles. Mais en 2026, la réputation IP s'est effondrée en tant que défense, et la taille du pool de proxy a cessé de prédire le succès réel.
Votre en-tête User-Agent n'a plus d'importance. Les empreintes au niveau de la connexion classent les bots avec une précision de 98,6 % avant même la lecture des en-têtes. Voici ce qui a changé en 2026.
La collecte de données d'entraînement pour l'IA passe d'un problème technique à un problème de conformité. L'EU AI Act et la surveillance accrue des fournisseurs redéfinissent les règles d'ici 2027.
La détection de bots est passée du blocage d'IP aux empreintes TLS, aux signaux du navigateur et à l'analyse comportementale. La plupart des configurations de scraping se trompent de combat.
Des sites web déploient des tarpits pour piéger les crawlers d'IA et leur injecter des données erronées. Mais ces pièges ne font pas la différence entre GPTBot et votre tracker de prix.