← 全部文章

大规模聚合房地产房源

各大房地产门户网站采用了不同的反爬虫技术栈、页面布局和地域限制。本文介绍如何在大规模聚合房源数据的同时,无需维护六套独立的爬虫。

挑战

你的团队上线了一款房源聚合产品。它平稳运行了三周。接着 Zillow 调整了 DOM 结构,Rightmove 收紧了 Bot 检查策略,仅在一个周末内,你的六个数据源中就有四个彻底失效。

房产数据聚合面临着价格监控和 SERP 追踪所没有的独特难题。你并非从单个规范的 API 中提取结构化数据,而是需要拼接来自各个门户的房源信息,而这些平台各自采用不同的反爬技术栈、页面布局、地域策略和更新频率。美国的 Zillow、提供 MLS 数据的 Redfin、英国的 Rightmove、澳大利亚的 realestate.com.au 以及德国的 Immobilienscout24。每个门户都是一个独立的工程项目。

根据 Scrapfly 的 2026 年研究报告,头部房产门户会检查连接层特征签名,并直接拒绝与浏览器握手特征不匹配的客户端。他们的 Rightmove 指南 详细分析了嵌入在 JavaScript 变量中的 JSON 数据,其结构每隔几个月就会发生变动。Redfin 将房产数据分散在数十个 DOM 节点中,一次简单的布局调整就可能导致半数字段丢失。区域门户还会根据访问者所在国家/地区展示不同内容,这意味着位于美国的爬虫在 realestate.com.au 上获取不到任何有效信息。

其结果是:你的房源时效性在无声无息中下降。三分之一的房产数据在 48 小时内失效。用户看到的是上周的价格。销售团队开始收到客户质疑,而支持工单总在周一激增,因为各大门户往往选在周末变更页面布局。

应对方案

规模化聚合房源数据本质上不是爬虫问题,而是一个伪装成爬虫问题的系统可靠性问题。为什么你的爬虫总是失效 讨论了通用情况,而房产领域则放大了其中的每一个环节。

任何能够妥善解决此问题的平台都需要四项能力的协同配合。第一,与真实浏览器完全一致的 request 特征签名(不仅仅是形似浏览器的 User-Agent 字符串,还包括 Zillow 和 Rightmove 用于区分 Bot 与人类的真实传输层细节)。第二,覆盖所有目标市场的精准地理定位住宅 IP,因为德国聚合平台无法使用美国数据中心流量请求 Immobilienscout24 并期望获得有效 response。第三,基于 Host 的代理路由,因为适用于 Zillow 的策略在 realestate.com.au 上会直接失效。第四,针对将所有内容推向客户端渲染的门户,提供浏览器渲染降级方案。

通过 FourA 的 Proxy 产品请求 Rightmove 的示例如下:

curl -X POST https://api.foura.ai/api/proxy/ \
  -H "x-api-key: YOUR_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "maxTries": 5,
    "timeout_ms": 45000,
    "request": {
      "method": "GET",
      "url": "https://www.rightmove.co.uk/properties/123456",
      "unblocker": true,
      "followRedirects": 5,
      "validate": {
        "status": {"accept": [200]},
        "data": {"fail": ["blocked", "access denied"]}
      }
    }
  }'

unblocker 标志会在注入完整浏览器 header 集合的同时匹配对应的传输层特征。maxTries: 5 会指示 proxy 管理器轮换最多 5 个 IP,直到请求成功。验证规则可捕获静默拦截,即那些返回软拒绝页面而非房源数据、HTTP 状态码却为 200 的响应。因此你的成功率反映的是实际成功的抓取,而不是 HTTP 状态声称的结果。

完全依赖 JavaScript 渲染内容的门户网站(Redfin 就是典型例子)需要真实的浏览器渲染。我们的 Browser 产品通过完整的浏览器实例处理这些请求,而不是首次连接就会被标记的轻量级模拟器。Bot 检测在 2026 年已转向行为分析,任何达不到真实浏览器水准的工具都愈发容易被识别。

实际成效

当房地产聚合平台从自研抓取架构切换到 API 优先方案时会发生什么?以下是我们在实际业务中观察到的模式(基于行业基准的示例场景):

  • 房源新鲜度在活跃市场中从“48 小时内更新”提升至“2 小时内更新”
  • 爬虫维护占用的工程时间减少 70%,仅需一名工程师轮值,无需专职团队
  • 门户覆盖量从 6 个站点扩展到 20+ 个,基础设施成本未见成比例增长
  • 配合验证规则捕获软拦截后,受保护门户上的静默拦截率降至 3% 以下

使用我们平台的团队都有一个共同特征:一旦底层可靠性实现统一,接入新市场就只是修改配置,而不再需要一个开发周期。核心议题从“为什么又挂了”转变为“接下来该接入哪个门户”。

客观限制在于:需要登录会话的房地产门户(部分 MLS 系统、特定的中介专享视图)除了请求基础设施外,还需要账号管理能力。这是另一个我们不解决的问题,如果有人声称能解决却不解释实现细节,请保持审慎。

核心结论

房地产是少数几个“过期数据不仅是体验瑕疵,而是产品级故障”的行业之一。时尚网站上一周前的价格只是一次小尴尬;而在热门房地产市场中,一周前的房源意味着用户可能正在咨询一套周二就已经售出的房屋。

能在这类业务中脱颖而出的团队,不是拥有最多数据源的团队,而是不再为每个新门户重复构建 proxy 和请求底层管道的团队。一旦该层基础设施完成统一,核心业务才真正开始:数据质量、新鲜度 SLA、跨门户去重以及价格趋势分析。这才是产品价值所在,底层的一切本就应当稳定运行。