← Todos los artículos

FourA aparece en Dawn, y ese es el surgimiento de algo

Dawn lanzó una integración con FourA esta semana. Detrás de cada respuesta de un agente que interactúa con la web en vivo, ahora hay una llamada de extracción. Esta es la forma que está surgiendo.

Un ingeniero abre Dawn y pide: "Haz scraping de https://topstartups.io/ y dame las primeras 10 startups, incluyendo nombres, descripciones, sede, año de fundación, URLs y páginas de redes sociales, formateado como una tabla".

El agente piensa por un momento, obtiene la página, analiza los listados, sigue el perfil de cada startup y devuelve la tabla. Diez filas. Cada columna completa. Pogo, Auctor, Scalify, Omnea, Rivan, Listen Labs, Doppel, Blossom, Avoca, Traba. Sedes en Brooklyn, Nueva York, Londres, San Francisco, Remoto. LinkedIn para la mayoría. Años de fundación entre 2020 y 2026.

Esa tabla fue el resultado de un puñado de llamadas a FourA.

Esta semana Dawn incorporó FourA como una herramienta de primer nivel dentro de su plataforma de agentes. Se ubica en su panel de integraciones junto a Notion, GitHub y Google Drive. Los agentes con acceso a FourA pueden obtener una página web pública o un endpoint HTTP, parsear la response (incluyendo JSON), enviar un formulario, verificar disponibilidad y extraer texto o enlaces específicos de lo que se recibe. Cada agente tiene acceso explícito o no lo tiene. Gobernanza por agente, sin el riesgo de dar acceso a internet de forma indiscriminada.

FourA in Dawn's integrations grid, alongside OneDrive, MailJet, Linear, Jira, and Trello FourA in Dawn's integrations grid, alongside OneDrive, MailJet, Linear, Jira, and Trello

Lo interesante no es que un agente pueda consultar una URL. La búsqueda web ha existido en las plataformas de agentes durante un año. Lo interesante es la forma de la herramienta que está surgiendo.

La búsqueda web y la extracción de URL son tareas distintas. La búsqueda sirve para saber "qué dice internet sobre X". Información amplia, generativa y a nivel de resumen. La extracción sirve para "aquí está la URL o el endpoint, consúltalo y devuélveme la respuesta estructurada". Tienen diferentes requisitos de confiabilidad, diferentes perfiles de costo y diferentes modos de falla. Mezclarlas en una sola herramienta produce un resultado mediocre para ambos casos.

La integración de Dawn las trata como elementos separados. Tienen una capacidad /web-research para la tarea amplia. FourA es para la tarea específica. Un agente recurre a la herramienta adecuada según lo que realmente necesita. Y ese es el patrón de maduración que estamos empezando a ver en las plataformas de agentes en 2026: la extracción está pasando de ser "una búsqueda añadida como parche" a convertirse en su propia primitiva.

Para el ingeniero de plataforma que está leyendo esto

Dawn expone FourA como ocho herramientas designadas, cada una asignada a un patrón de extracción común:

  • foura_fetch_page para páginas HTML y de texto
  • foura_extract_text para contenido limpio y legible
  • foura_extract_links para navegación, formularios, scripts y estilos
  • foura_fetch_json para endpoints de API
  • foura_head_url para headers, status y redirecciones
  • foura_probe_site para verificaciones rápidas de accesibilidad
  • foura_submit_form para envíos de formularios sin inicio de sesión
  • foura_single_request para HTTP arbitrario

El agente elige en función de lo que exige la consulta. La consulta de topstartups anterior utilizó tres de ellas en secuencia: un fetch, un extract y un seguimiento.

La integración es lo suficientemente simple como para realizarse en un día. Por debajo operan dos variantes de request: un modo directo con una firma de request de nivel de navegador para sitios sin bloqueos agresivos, y un modo enrutado por proxy para todo lo demás. Ambos comparten la misma estructura de request: URL, headers y body opcionales, y parseo de response opcional. El agente elige según lo que exija el sitio de destino.

El contrato que una plataforma ofrece a sus agentes suele ser el siguiente:

  • Un conjunto reducido de capacidades (fetch / extract / probe / submit), cada una con una definición de herramienta enfocada a la que el agente puede recurrir
  • Modo proxy por defecto, con fallback a directo cuando la latencia o el costo importan
  • Permisos por agente para que los clientes de la plataforma mantengan el control
  • Parseo de response estructurado expuesto como parámetro de la herramienta, no oculto en un system prompt

Pero la parte que la mayoría de los ingenieros de plataforma subestima es lo que sucede en los casos extremos. El 80% de los casos (un fetch que responde en 200 ms y devuelve HTML limpio) es la mitad fácil. El otro 20% (sitios que bloquean según la firma del request, que insertan un JS challenge en la response o que devuelven un 403 por bloqueo de IP de nube) es lo que determina si tu agente entrega una respuesta correcta o una alucinada. Reconstruimos nuestra ruta de request precisamente para esos casos extremos, y la diferencia entre "parece confiable" y "es realmente confiable" representa la mayor parte del trabajo.

Por lo tanto, si gestionas una plataforma de agentes y tus clientes no dejan de preguntar cómo pueden sus agentes "simplemente consultar esta URL", ese es el patrón. La documentación está en /docs. Con gusto te guiaremos en el proceso.

Para todos los demás

No verás nada de esto. Simplemente notarás que cuando le hagas a un asistente de IA una pregunta que requiera consultar una página web real en ese momento, responderá correctamente en lugar de adivinar o disculparse.

Ese es el resultado visible para el usuario de una primitiva de extracción lo suficientemente confiable como para coexistir junto a GitHub y Google Drive en una cuadrícula de integraciones. Deja de ser un proyecto de investigación. Pasa a ser infraestructura básica.

Por qué es importante

Hace seis meses, un agente que necesitaba leer una página web requería un desarrollo a medida. Prompts personalizados, scrapers frágiles, reintentos artesanales, una tasa de éxito del 60% en un buen día. La estructura no era la adecuada porque la capa aún no existía. Y los sitios que el agente consultaba cambiaban constantemente. La detección de bots pasó de señales estáticas a comprobaciones de comportamiento, por lo que los scrapers improvisados se degradaban más rápido de lo que los equipos podían parchearlos.

Ahora la capa está tomando forma. Dawn la adoptó y lanzó una integración. Esperamos que más plataformas de agentes sigan el mismo camino este año, y prevemos que el contrato converja: una herramienta dedicada para búsqueda, una herramienta dedicada para extracción, gobernanza por agente y costos predecibles.

Estamos al inicio. Pero así es como se ve el surgimiento de algo nuevo. Cuando una funcionalidad deja de ser un proyecto y pasa a ser un componente listo para conectar.

Si desarrollas una plataforma de agentes y quieres implementar la misma estructura, contáctanos. Si creas agentes en Dawn, FourA ya está disponible allí. Solo actívalo.