Les données sur les prix du bois en Europe sont techniquement publiques, mais pratiquement inutilisables. Un pays affiche les cours du chêne en euros par mètre cube hors taxes. Une nation voisine publie les prix du hêtre en devise locale, toutes taxes comprises, au fin fond d'un PDF scanné sans texte sélectionnable. Pour aggraver les choses, le bois sur pied, les grumes bord de route et les lots d'enchères sélectionnés sont souvent cités côte à côte, comme s'il s'agissait de produits identiques.
Les données brutes existent. L'intelligence de marché, non.
KORENA a lancé le KORENA Timber Index pour résoudre ce problème. Le résultat est une référence quotidienne et accessible gratuitement pour les prix des feuillus, du bois d'œuvre et des plots en Europe. À la mi-2026, l'indice suit environ deux douzaines d'essences et 170 séries de prix régionaux à travers dix pays (Roumanie, Allemagne, Bulgarie, Pologne, France, Autriche, Italie, Finlande, Norvège, Suède), en plus d'un niveau pour les places de marché paneuropéennes.
Pour qu'une équipe d'ingénierie de deux personnes couvre autant de terrain, KORENA devait trancher une décision essentielle: qui gère l'accès au web. Ils ont choisi FourA, et ils ont tout fait transiter par là.
Une passerelle unique vers le Web
KORENA a fait un choix d'architecture dès le départ: chaque requête web externe passe par FourA. Ils ont éliminé les scrapers isolés, les scripts ad hoc et les commandes personnalisées enfouies dans le codebase.
Ce n'était pas une question de confort. C'était une question de cohérence. Les portails forestiers ont des comportements imprévisibles. Certains sont des pages HTML statiques. D'autres sont des plateformes d'enchères modernes qui n'affichent les données qu'après le rendu d'un navigateur. Les sites gouvernementaux sont souvent lents, obsolètes ou lourdement protégés.
En routant l'ensemble du trafic via l'infrastructure de requêtes de FourA, KORENA gère les retries, le backoff, les logs et les alertes de manière uniforme pour toutes les sources. Et chaque document récupéré peut être haché, stocké et rattaché à son prix final pour l'audit.
Choisir la bonne stratégie de récupération par source
Au lieu de coder en dur la logique de scraping pour chaque site, KORENA associe chaque source de données à un endpoint FourA spécifique directement dans sa base de données (voir choisir le bon type de tâche pour l'analyse complète). Ils peuvent ainsi changer de stratégie sans modifier leur code de parsing principal:
Single (
/single/): pages HTML statiques, flux XML et téléchargements directs de PDF. Rapports statistiques allemands, mises à jour des forêts publiques bulgares, tableaux de prix roumains. Rapide, léger, le choix par défaut idéal pour la plupart des sites.Browser (
/browser/): applications web interactives nécessitant un vrai contexte de navigateur. La plateforme d'enchères polonaise e-Drewno impose un rendu complet avant que les chiffres n'apparaissent. Le HTML initial ne contient rien d'exploitable.Proxy Finder (
/proxy/): la solution de repli pour les cibles les plus difficiles. Une rotation plus robuste, accompagnée deunblocker: truepour les contrôles au niveau du handshake.
Comme il s'agit d'un paramètre par source et non d'un script codé en dur, KORENA peut faire passer une source de Single à Browser puis à Proxy Finder lorsqu'un site modifie ses défenses. La couche d'analyse syntaxique ne le voit jamais.
PDF scannés : la partie la plus difficile
Les API web modernes sont simples. Le cas le plus difficile à automatiser reste les PDF composés uniquement d'images. Des listes de prix et des résultats d'enchères publiés sous forme de scans, sans aucune couche de texte. Pour un humain, c'est pénible. Pour un index quotidien, cela bloque le pipeline.
Le pipeline de KORENA les traite grâce à une séparation nette des tâches :
Récupération : FourA télécharge les octets bruts du PDF, chaque jour, de manière fiable.
Évaluation du texte : KORENA vérifie si le fichier dispose d'une couche de texte native exploitable.
Traitement et extraction : si le PDF est une image plate, KORENA rastérise les pages et les traite par OCR et extraction documentaire par IA, en appliquant des indices linguistiques personnalisés et des dictionnaires d'essences pour identifier la terminologie forestière locale.
Validation du schéma : la sortie est validée selon le même schéma que toutes les autres sources.
Rien de tout cela ne fonctionne si vous ne pouvez pas récupérer le document de manière fiable chaque jour. C'est l'étape prise en charge par FourA.
Récupération ou compréhension : une séparation nette
Le rôle de FourA est de livrer des octets bruts de manière fiable. Il n'a pas besoin d'avoir des connaissances sur le bois. Cela permet à KORENA de concentrer 100 % de son énergie sur son cœur de métier : transformer des données chaotiques en un index standardisé. Tout ce qui est spécifique au domaine reste chez KORENA. Le HTML est analysé localement, les PDF numériques sont lus avec pdfjs-dist, et les PDF scannés sont traités par OCR.
L'étape de normalisation permet de transformer des chiffres bruts en un index. Le prix d'un arbre sur pied n'est pas le prix d'un bois de sciage, et le résultat d'une vente aux enchères locale toutes taxes comprises n'est pas directement comparable à un devis d'exportation hors taxes. Pour convertir des données brutes en renseignements commerciaux comparables, KORENA convertit toutes les données selon une norme unique : Euros par mètre cube, hors TVA, équivalent rendu.
Pour y parvenir avec précision, le système prend en compte :
- Les taux de change quotidiens de la Banque centrale européenne.
- Les règles locales de TVA par pays.
- Les facteurs de transport basés sur le stade de transformation du bois.
L'index maintient également la séparation entre les différents niveaux du marché. Le bois rond en vrac, les enchères de bois de valeur et les annonces de vente au détail apparaissent dans des catégories distinctes et ne sont jamais mélangés. Un lot d'enchère premium ne vient pas fausser la référence de base.
Cette séparation est essentielle : FourA résout l'accès au web, KORENA résout la filière bois. Aucun des deux ne devient une boîte noire dont l'autre dépend.
Pourquoi la transparence des prix du bois devient urgente
Des réglementations européennes plus strictes, notamment le règlement de l'UE sur la déforestation (RDUE), poussent le marché du bois vers une traçabilité totale et une documentation d'approvisionnement plus claire. La transparence des prix représente l'autre volet de cette équation. Les producteurs de bois comparant les valeurs régionales, les acheteurs validant des devis et les places de marché numériques établissant des taux de référence ont tous besoin de données quotidiennes, localisées et comparables. Pas de moyennes annuelles obsolètes. Pas de chiffres locaux isolés.
Pour qu'une équipe d'ingénierie restreinte de deux personnes couvre dix pays et des centaines de formats web imprévisibles, elle ne pouvait pas se permettre de passer son temps à gérer une infrastructure de proxy, des parcs de navigateurs et des correctifs site par site (voir le coût caché de la maintenance de vos propres scrapers pour le calcul complet). FourA gère la couche de requêtes. KORENA récupère ce temps pour se concentrer sur la normalisation des essences, l'ajustement de l'OCR, la logique de tarification et les pistes d'audit, le travail qu'eux seuls peuvent accomplir.
Auparavant, obtenir les cours quotidiens du bois impliquait un appel téléphonique à votre courtier régional. Désormais, chacun peut tracer lui-même la courbe sur timber-index.korena.eu. Les dix prochains produits similaires à cet Index n'auront pas le temps de concevoir la couche de collecte à partir de zéro. C'est le pari que nous faisons.
Vous développez un produit basé sur des données web publiques et vous êtes fatigué de maintenir vos propres scrapers et votre infrastructure de proxy ? Démarrez avec FourA.