Un ingénieur ouvre Dawn et demande : "Scrapez https://topstartups.io/ et donnez-moi les 10 premières startups, incluant les noms, les descriptions, le siège, l'année de création, les URLs, les pages sociales, formaté en tableau."
L'agent réfléchit un instant, récupère la page, analyse les listes, suit le profil de chaque startup, et retourne le tableau. Dix lignes. Chaque colonne renseignée. Pogo, Auctor, Scalify, Omnea, Rivan, Listen Labs, Doppel, Blossom, Avoca, Traba. Des sièges à Brooklyn, New York, Londres, San Francisco, Remote. LinkedIn pour la plupart. Années de création de 2020 à 2026.
Ce tableau était le résultat de quelques appels FourA.
Cette semaine Dawn a publié FourA comme un outil de premier plan dans sa plateforme d'agents. Il se trouve dans leur grille d'intégrations à côté de Notion, GitHub, et Google Drive. Les agents ayant accès à FourA peuvent récupérer une page web publique ou un endpoint HTTP, analyser la réponse (incluant du JSON), soumettre un formulaire, vérifier l'accessibilité, et extraire du texte spécifique ou des liens de ce qui revient. Chaque agent a un accès explicite ou n'en a pas. Une gouvernance par agent, pas de piège du type "chaque agent accède à internet".
Ce qui est intéressant n'est pas qu'un agent puisse requêter une URL. La recherche web existe dans les plateformes d'agents depuis un an. Ce qui est intéressant, c'est la structure de l'outil qui émerge.
La recherche web et l'extraction d'URL sont des tâches différentes. La recherche sert à "que dit internet sur X ?". Une information large, générative, de type résumé. L'extraction sert à "voici l'URL ou l'endpoint, récupérez-le et donnez-moi la réponse structurée". Différentes exigences de fiabilité, différents profils de coûts, différents modes d'échec. Les mélanger dans un seul outil produit une réponse médiocre pour les deux.
L'intégration de Dawn les traite séparément. Ils ont une capacité /web-research pour la tâche large. FourA est pour la tâche ciblée. Un agent utilise le bon outil en fonction de ce dont il a réellement besoin. Et c'est le modèle de maturation que nous commençons à voir dans les plateformes d'agents en 2026 : l'extraction passe de "recherche greffée" à sa propre primitive.
Pour l'ingénieur de plateforme qui lit ceci
Dawn expose FourA sous forme de huit outils nommés, chacun correspondant à un modèle d'extraction commun :
foura_fetch_pagepour les pages HTML et textefoura_extract_textpour le contenu lisible proprefoura_extract_linkspour la navigation, les formulaires, les scripts, et les stylesfoura_fetch_jsonpour les endpoints APIfoura_head_urlpour les headers, les statuts, les redirectionsfoura_probe_sitepour les vérifications rapides d'accessibilitéfoura_submit_formpour les soumissions de formulaires sans connexionfoura_single_requestpour le HTTP arbitraire
L'agent choisit en fonction des exigences de la question. La requête topstartups ci-dessus en a utilisé trois en séquence : une récupération, une extraction, un suivi.
L'intégration est assez simple pour être faite en un jour. Deux variantes de requêtes se trouvent en dessous : un mode direct avec une signature de requête de niveau navigateur pour les sites qui ne bloquent pas agressivement, et un mode proxy routé pour tout le reste. Les deux partagent la même forme de requête : URL, headers et body optionnels, analyse de réponse optionnelle. L'agent choisit en fonction de ce que le site cible exige.
Le contrat qu'une plateforme offre à ses agents ressemble généralement à cela :
- Un petit ensemble de capacités (fetch / extract / probe / submit), chacune avec une définition d'outil ciblée que l'agent peut utiliser
- Mode proxy par défaut, retour au mode direct quand la latence ou le coût importe
- Permission par agent pour que les clients de la plateforme conservent la gouvernance
- Analyse de réponse structurée exposée comme un paramètre d'outil, non enfouie dans un prompt système
Mais la partie que la plupart des ingénieurs de plateforme sous-estiment est ce qui se passe à la marge. Le cas des 80% (une récupération réussit en 200ms, retourne du HTML propre) est la moitié facile. Les 20% restants (les sites qui bloquent sur la signature de la requête, qui lancent un défi JS dans la réponse, qui font une erreur 403 sur un bloc d'IP cloud) sont ce qui détermine si votre agent fournit une réponse correcte ou une hallucination. Nous avons reconstruit notre chemin de requête exactement pour cette marge, et la différence entre "semble fiable" et "réellement fiable" constitue l'essentiel du travail.
Donc si vous gérez une plateforme d'agents et que vos clients continuent de demander comment leurs agents pourraient "juste vérifier cette URL", c'est le modèle. Les documents sont sur /docs. Nous sommes ravis de vous guider à travers cela.
Pour tous les autres
Vous ne verrez rien de tout cela. Vous remarquerez juste que lorsque vous posez une question à un assistant IA qui nécessite de consulter une vraie page web maintenant, il répond correctement au lieu de deviner ou de s'excuser.
C'est le résultat orienté utilisateur d'une primitive d'extraction assez fiable pour vivre à côté de GitHub et Google Drive dans une grille d'intégrations. Cela cesse d'être un projet de recherche. Cela devient de la plomberie.
Pourquoi c'est important
Il y a six mois, un agent qui devait lire une page web était une construction sur mesure. Des prompts personnalisés, des scrapers fragiles, des tentatives manuelles, un taux de réussite de 60% dans un bon jour. La structure était mauvaise car la couche n'existait pas encore. Et les sites que l'agent requêtait continuaient de changer. La technologie anti-bot est passée de signaux statiques à des vérifications comportementales, donc les scrapers bricolés se sont dégradés plus vite que les équipes ne pouvaient les corriger.
Maintenant la couche se forme. Dawn l'a adoptée et a publié une intégration. Nous nous attendons à ce que d'autres plateformes d'agents suivent cette année, et nous nous attendons à ce que le contrat converge : un outil dédié pour la recherche, un outil dédié pour l'extraction, une gouvernance par agent, un coût prévisible.
Nous sommes au début. Mais c'est à cela que ressemble l'émergence de quelque chose. Quand une capacité cesse d'être un projet et devient une brique.
Si vous construisez une plateforme d'agents et voulez expédier la même structure, dites bonjour. Si vous construisez des agents sur Dawn, FourA est déjà là. Activez-le.