← Todos os posts

Agregando anúncios de imóveis em escala

Portais imobiliários usam diferentes stacks de detecção de bots, layouts e geografias. Veja como agregar anúncios em escala sem precisar manter seis scrapers.

O desafio

Sua equipe lança um produto de anúncios de imóveis. Ele funciona por três semanas. Então a Zillow altera seu DOM, o Rightmove reforça suas verificações de bot, e seu scraper para de funcionar em quatro de seis fontes ao longo de um único fim de semana.

A agregação de dados imobiliários tem um problema específico que o monitoramento de preços e o rastreamento de SERP não compartilham. Você não está extraindo dados estruturados de uma única API limpa. Você está unindo anúncios de portais que utilizam, cada um, diferentes pilhas de detecção de bots, layouts distintos, geografias diversas e diferentes frequências de atualização. Zillow nos EUA, Redfin para dados baseados em MLS, Rightmove no Reino Unido, realestate.com.au na Austrália, Immobilienscout24 na Alemanha. Cada portal é um projeto de engenharia à parte.

De acordo com a pesquisa de 2026 da Scrapfly, os principais portais imobiliários inspecionam a assinatura no nível de conexão e rejeitam clientes que não correspondem a um handshake de nível de navegador. O guia sobre o Rightmove deles detalha o JSON incorporado em variáveis JavaScript que muda de estrutura a cada poucos meses. A Redfin fragmenta os dados de propriedades em dezenas de nós do DOM, de modo que um único ajuste de layout pode remover metade dos seus campos de uma vez. E portais regionais entregam conteúdos diferentes com base no país do visitante, o que significa que um scraper baseado nos EUA não vê nada útil no realestate.com.au.

O resultado: o frescor dos seus anúncios degrada silenciosamente. Um terço dos seus imóveis fica desatualizado em 48 horas. Seus usuários veem preços da semana passada. Sua equipe de vendas começa a enfrentar resistência, e seus tickets de suporte disparam nas segundas-feiras porque os layouts dos portais costumam mudar nos fins de semana.

A abordagem

Agregar anúncios em escala não é um problema de scraping. É um problema de confiabilidade disfarçado de scraping. Por que seu scraper continua quebrando aborda o caso geral. O setor imobiliário amplifica cada parte dele.

Qualquer plataforma que lide bem com isso precisa de quatro elementos funcionando em conjunto. Primeiro, uma assinatura de request que corresponda a navegadores reais (não apenas uma string de User-Agent parecida com a de um navegador, mas os detalhes reais no nível do protocolo que Zillow e Rightmove usam para separar bots de humanos). Segundo, IPs residenciais com precisão geográfica em cada mercado-alvo, porque um agregador alemão não pode enviar tráfego de datacenter dos EUA para o Immobilienscout24 e esperar respostas úteis. Terceiro, roteamento de proxy por host, porque a estratégia que funciona no Zillow falha no realestate.com.au. Quarto, renderização de navegador como fallback para portais que processam tudo no lado do cliente.

Uma request de exemplo para o Rightmove usando o produto Proxy da FourA se parece com isto:

curl -X POST https://api.foura.ai/api/proxy/ \
  -H "x-api-key: YOUR_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "maxTries": 5,
    "timeout_ms": 45000,
    "request": {
      "method": "GET",
      "url": "https://www.rightmove.co.uk/properties/123456",
      "unblocker": true,
      "followRedirects": 5,
      "validate": {
        "status": {"accept": [200]},
        "data": {"fail": ["blocked", "access denied"]}
      }
    }
  }'

A flag unblocker injeta um conjunto completo de headers de navegador junto com a assinatura de rede correspondente. maxTries: 5 instrui o gerenciador de proxy a rotacionar por até cinco IPs até que um funcione. As regras de validação detectam bloqueios silenciosos: as respostas 200 que retornam uma página de recusa sutil em vez dos dados do anúncio. Assim, sua taxa de sucesso reflete o que realmente funcionou, não o que o status HTTP alegou.

Portais que entregam tudo via JavaScript (o Redfin é o exemplo óbvio) exigem renderização real em navegador. Nosso produto Browser lida com esses casos usando uma instância completa de navegador, e não um emulador leve que é sinalizado logo na primeira conexão. A detecção de bots tornou-se comportamental em 2026, e qualquer coisa inferior a um navegador real fica cada vez mais visível.

Resultados

O que acontece quando um agregador imobiliário migra de uma stack própria de scraping para uma abordagem API-first? Os padrões que vemos em operações reais (cenário ilustrativo baseado em benchmarks do setor):

  • Atualização dos anúncios melhora de "atualizado em até 48 horas" para "atualizado em até 2 horas" em mercados ativos
  • Tempo de engenharia na manutenção de scrapers cai 70%. Um engenheiro em plantão em vez de uma equipe dedicada
  • Cobertura de portais expande de 6 sites para mais de 20 sem aumento proporcional de infraestrutura
  • Taxas de bloqueio silencioso caem para menos de 3% em portais protegidos assim que as regras de validação capturam bloqueios sutis

Um padrão entre equipes que usam nossa plataforma: com a camada de confiabilidade unificada, adicionar um novo mercado passa a ser uma alteração de configuração em vez de uma sprint inteira. As perguntas importantes mudam de "por que isso quebrou de novo?" para "qual portal devemos adicionar agora?".

Uma limitação honesta: portais imobiliários que exigem sessões autenticadas (alguns sistemas de MLS, certas visualizações exclusivas para corretores) precisam de gerenciamento de contas além da infraestrutura de requisições. Esse é um problema separado que não resolvemos, e você não deve confiar em ninguém que afirme resolver sem explicar como.

Principal Conclusão

O setor imobiliário é um dos poucos em que dados desatualizados não são apenas um incômodo. São uma falha de produto. Um preço desatualizado há uma semana em um site de moda é um detalhe embaraçoso. Um anúncio de uma semana atrás em um mercado aquecido significa que seu usuário acabou de consultar um imóvel vendido na terça-feira.

Mas as equipes que vencem nesse mercado não são as que têm mais fontes. São as que pararam de reconstruir a mesma estrutura de proxy e requisições para cada novo portal. Uma vez que essa camada está compartilhada, o trabalho que realmente importa começa: qualidade dos dados, SLAs de atualização, deduplicação entre portais e análise de tendências de preços. Esse é o produto. Tudo o que está por baixo deveria apenas funcionar.