El desafío
Tu equipo lanza un producto de listados. Funciona durante tres semanas. Luego Zillow cambia su DOM, Rightmove ajusta sus controles de bots y tu scraper se apaga en cuatro de seis fuentes en un solo fin de semana.
La agregación de propiedades tiene un problema específico que el monitoreo de precios y el seguimiento de SERP no comparten. No estás extrayendo datos estructurados de una API limpia. Estás uniendo listados de portales que usan diferentes stacks anti-bot, diferentes layouts, diferentes geografías y diferentes ritmos de actualización. Zillow en EE. UU., Redfin para datos respaldados por MLS, Rightmove en el Reino Unido, realestate.com.au en Australia, Immobilienscout24 en Alemania. Cada portal es su propio proyecto de ingeniería.
Según la investigación de Scrapfly de 2026, los principales portales inmobiliarios inspeccionan la firma a nivel de conexión y rechazan los clientes que no coinciden con un handshake de nivel de navegador. Su guía de Rightmove detalla el JSON incrustado en variables de JavaScript que cambia de estructura cada pocos meses. Redfin fragmenta los datos de propiedades en docenas de nodos del DOM, por lo que un solo ajuste de layout puede eliminar la mitad de tus campos a la vez. Y los portales regionales sirven contenido diferente según el país del visitante, lo que significa que un scraper basado en EE. UU. no ve nada útil en realestate.com.au.
El resultado: la frescura de tus listados se degrada silenciosamente. Un tercio de tus propiedades quedan obsoletas en 48 horas. Tus usuarios ven los precios de la semana pasada. Tu equipo de ventas comienza a recibir quejas, y tus tickets de soporte se disparan los lunes porque los layouts de los portales tienden a cambiar los fines de semana.
El enfoque
Agregar listados a gran escala no es un problema de scraping. Es un problema de confiabilidad disfrazado de uno. Por qué tu scraper se sigue rompiendo cubre el caso general. El sector inmobiliario amplifica cada parte de este problema.
Cualquier plataforma que maneje esto bien necesita cuatro cosas trabajando juntas. Primero, una firma de request que coincida con navegadores reales (no solo una cadena User-Agent con forma de navegador, sino los detalles reales a nivel de red que Zillow y Rightmove usan para separar los bots de los humanos). Segundo, IPs residenciales con precisión geográfica en cada mercado objetivo, porque un agregador alemán no puede enviar tráfico de datacenter de EE. UU. a Immobilienscout24 y esperar responses útiles. Tercero, enrutamiento proxy por host, porque la estrategia que funciona en Zillow falla en realestate.com.au. Cuarto, renderizado de navegador como respaldo para los portales que envían todo al lado del cliente.
Un request de ejemplo contra Rightmove a través del producto Proxy de FourA se ve algo así:
curl -X POST https://api.foura.ai/api/proxy/ \
-H "x-api-key: YOUR_KEY" \
-H "Content-Type: application/json" \
-d '{
"maxTries": 5,
"timeout_ms": 45000,
"request": {
"method": "GET",
"url": "https://www.rightmove.co.uk/properties/123456",
"unblocker": true,
"followRedirects": 5,
"validate": {
"status": {"accept": [200]},
"data": {"fail": ["blocked", "access denied"]}
}
}
}'
El flag unblocker inyecta un conjunto completo de header de navegador junto con la firma correspondiente a nivel de red. maxTries: 5 le dice al administrador del proxy que rote hasta por cinco IPs hasta que una tenga éxito. Las reglas de validación capturan los bloqueos silenciosos: los responses 200 que devuelven una página de bloqueo suave en lugar de datos de listados. Así que tu tasa de éxito refleja lo que realmente funcionó, no lo que afirmó el estado HTTP.
Los portales que sirven todo a través de JavaScript (Redfin es el ejemplo obvio) necesitan renderizado de navegador real. Nuestro producto Browser maneja esos casos con una instancia de navegador completa, no un emulador ligero que es marcado en la primera conexión. La detección de bots se volvió conductual en 2026, y cualquier cosa inferior a un navegador real es cada vez más visible.
Resultados
¿Qué pasa cuando un agregador inmobiliario cambia de un stack de scraping personalizado a un enfoque centrado en la API? Los patrones que vemos en operaciones reales (escenario ilustrativo basado en puntos de referencia de la industria):
- La frescura de los listados mejora de "actualizado en 48 horas" a "actualizado en 2 horas" para mercados activos
- El tiempo de ingeniería en el mantenimiento de scrapers cae un 70%. Un ingeniero en rotación en lugar de un equipo dedicado
- La cobertura de portales se expande de 6 sitios a más de 20 sin un aumento proporcional en la infraestructura
- Las tasas de bloqueo silencioso caen por debajo del 3% en portales protegidos una vez que las reglas de validación capturan los bloqueos suaves
Un patrón de los equipos que usan nuestra plataforma: una vez que se comparte la capa de confiabilidad, agregar un nuevo mercado se convierte en un cambio de configuración en lugar de un sprint. Las preguntas interesantes cambian de "por qué se rompió esto de nuevo" a "qué portal deberíamos agregar a continuación."
La limitación honesta: los portales inmobiliarios que requieren sesiones iniciadas (algunos sistemas MLS, ciertas vistas solo para agentes) necesitan administración de cuentas por encima de la infraestructura de request. Ese es un problema separado que no resolvemos, y no deberías confiar en nadie que diga que lo hace sin explicar cómo.
Conclusión clave
El sector inmobiliario es una de las pocas industrias donde los datos obsoletos no son una molestia. Son un fallo del producto. Un precio de hace una semana en un sitio de moda es una leve vergüenza. Un listado de hace una semana en un mercado activo significa que tu usuario acaba de preguntar por una casa que se vendió el martes.
Pero los equipos que ganan en esto no son los que tienen más fuentes. Son los que han dejado de reconstruir el mismo proxy y la misma infraestructura anti-bot para cada portal nuevo. Una vez que esa capa se comparte, comienza el trabajo interesante: calidad de los datos, SLAs de frescura, deduplicación entre portales, análisis de tendencias de precios. Ese es el producto. Todo lo que está debajo simplemente debería funcionar.