Un ingeniero abre Dawn y pide: "Haz scraping en https://topstartups.io/ y dame las primeras 10 startups, incluyendo nombres, descripciones, sedes, año de fundación, URLs, páginas sociales, con formato de tabla".
El agente piensa por un momento, recupera la página, analiza los listados, sigue el perfil de cada startup y devuelve la tabla. Diez filas. Cada columna completada. Pogo, Auctor, Scalify, Omnea, Rivan, Listen Labs, Doppel, Blossom, Avoca, Traba. Sedes en Brooklyn, Nueva York, Londres, San Francisco, Remoto. LinkedIn para la mayoría. Años de fundación de 2020 a 2026.
Esa tabla fue el resultado de unas pocas llamadas a FourA.
Esta semana Dawn lanzó FourA como una herramienta de primera clase dentro de su plataforma de agentes. Se encuentra en su cuadrícula de integraciones junto a Notion, GitHub y Google Drive. Los agentes con acceso a FourA pueden recuperar una página web pública o un endpoint HTTP, analizar la response (incluido JSON), enviar un formulario, comprobar la accesibilidad y extraer texto o enlaces específicos de lo que devuelve. Cada agente tiene acceso explícito o no lo tiene. Gobernanza por agente, sin el peligro de que "todos los agentes tengan acceso a internet".
Lo interesante no es que un agente pueda acceder a una URL. La búsqueda web ha existido en las plataformas de agentes durante un año. Lo interesante es la forma de la herramienta que está surgiendo.
La búsqueda web y la extracción de URL son trabajos diferentes. La búsqueda es para "¿qué dice internet sobre X?". Información amplia, generativa, a nivel de resumen. La extracción es para "aquí está la URL o el endpoint, recupéralo y dame la respuesta estructurada". Diferentes requisitos de fiabilidad, diferentes perfiles de coste, diferentes modos de fallo. Mezclarlos en una sola herramienta produce una respuesta mediocre para ambos.
La integración de Dawn los trata por separado. Tienen una capacidad de /web-research para el trabajo amplio. FourA es para el trabajo específico. Un agente recurre a la herramienta adecuada según lo que realmente necesita. Y ese es el patrón de maduración que empezamos a ver en las plataformas de agentes en 2026: la extracción se está graduando de una "búsqueda añadida" a su propia primitiva.
Para el ingeniero de plataformas que lee esto
Dawn expone FourA como ocho herramientas con nombre, cada una mapeada a un patrón de extracción común:
foura_fetch_pagepara páginas HTML y de textofoura_extract_textpara contenido limpio y legiblefoura_extract_linkspara navegación, formularios, scripts y estilosfoura_fetch_jsonpara endpoints de APIfoura_head_urlpara cabeceras, estados y redireccionesfoura_probe_sitepara comprobaciones rápidas de accesibilidadfoura_submit_formpara envíos de formularios sin inicio de sesiónfoura_single_requestpara HTTP arbitrario
El agente elige según lo que exige la pregunta. La consulta topstartups anterior utilizó tres de ellas en secuencia: una recuperación, una extracción y un seguimiento.
La integración es lo bastante sencilla como para hacerla en un día. Por debajo hay dos tipos de request: un modo directo con una firma de request a nivel de navegador para los sitios que no bloquean agresivamente, y un modo enrutado por proxy para todo lo demás. Ambos comparten la misma forma de request: URL, cabeceras y cuerpo opcionales, análisis opcional de la response. El agente elige según lo que exija el sitio de destino.
El contrato que una plataforma ofrece a sus agentes suele ser así:
- Un pequeño conjunto de capacidades (recuperar / extraer / sondear / enviar), cada una con una definición de herramienta enfocada a la que el agente puede recurrir
- Modo proxy por defecto, con respaldo a modo directo cuando la latencia o el coste importan
- Permisos por agente para que los clientes de la plataforma conserven la gobernanza
- Análisis de response estructurado expuesto como parámetro de la herramienta, no oculto en un prompt del sistema
Pero la parte que la mayoría de los ingenieros de plataformas subestiman es lo que ocurre en la cola. El caso del 80% (una recuperación tiene éxito en 200ms, devuelve un HTML limpio) es la mitad fácil. El otro 20% (sitios que bloquean por la firma de la request, que lanzan un desafío JS en la response, que dan un 403 en un bloque de IP de la nube) es lo que determina si tu agente entrega una respuesta correcta o una alucinada. Reconstruimos nuestra ruta de request exactamente para esa cola, y la diferencia entre "parece fiable" y "es realmente fiable" supone la mayor parte del trabajo.
Así que si gestionas una plataforma de agentes y tus clientes no dejan de preguntar cómo sus agentes podrían "simplemente comprobar esta URL", ese es el patrón. La documentación está en /docs. Estaremos encantados de guiarte en el proceso.
Para todos los demás
No verás nada de esto. Solo notarás que cuando le haces a un asistente de IA una pregunta que requiere mirar una página web real en este momento, responde correctamente en lugar de adivinar o disculparse.
Ese es el resultado de cara al usuario de una primitiva de extracción lo bastante fiable como para convivir junto a GitHub y Google Drive en una cuadrícula de integraciones. Deja de ser un proyecto de investigación. Empieza a ser fontanería básica.
Por qué importa esto
Hace seis meses, un agente que necesitaba leer una página web era una construcción a medida. Prompts personalizados, scrapers frágiles, reintentos manuales, una tasa de éxito del 60% en un buen día. La forma era incorrecta porque la capa aún no existía. Y los sitios a los que accedía el agente seguían cambiando. La tecnología anti-bots pasó de señales estáticas a comprobaciones de comportamiento, por lo que los scrapers improvisados se degradaron más rápido de lo que los equipos podían parchearlos.
Ahora la capa se está formando. Dawn lo adoptó y lanzó una integración. Esperamos que más plataformas de agentes sigan el ejemplo este año, y esperamos que el contrato converja: una herramienta dedicada para búsqueda, una herramienta dedicada para extracción, gobernanza por agente, coste predecible.
Estamos al principio. Pero así es como se ve el surgimiento de algo. Cuando una capacidad deja de ser un proyecto y empieza a ser un conector.
Si desarrollas una plataforma de agentes y quieres lanzar la misma forma, saluda. Si construyes agentes en Dawn, FourA ya está ahí. Actívalo.