当 LLM 提取不再划算时
Firecrawl 抓取一个网页收取 1 个 credit,而从同一网页提取结构化字段收取 5 个 credit (Firecrawl pricing, 2026)。相同的 HTML 送入模型,价格翻了 5 倍。
它的卖点很实在:描述你的需求,获取 JSON 返回,无需维护选择器。对于不稳定的布局和一次性目标,它物有所值。但对于每天从同样的五个零售商处抓取 50 万个产品页面的生产流水线,它并不划算。
我们看到许多团队上线了默认使用 LLM 提取的功能,到月底收到账单时,就开始寻找出路。解决方法通常不是放弃 LLM。而是将其放在流水线的正确位置。
成本飞速上涨
以最便宜的 Firecrawl 为例。抓取加 AI 提取每页 6 个 credit,包含爬取则为 7 个 credit (ScrapeGraphAI breakdown, 2026)。在他们的增长套餐下,每天 10 万个网页每月大约需要 2.1 万美元,这还没算上重试,也没算上任何 proxy 的费用。
运行你自己的 LLM 流水线会改变成本结构,但并不会变小。GPT-4o 是每百万输入 tokens 2.50 美元,每百万输出 tokens 10 美元 (PricePerToken, 2026)。一个产品页面经过 markdown 转换后需要 4K 到 8K 个输入 tokens。假设 6K 输入,生成一个 JSON 的输出为 200。在每天 10 万个网页的情况下,每天需要 360 美元,每月 1.1 万美元,而这项工作如果用 CSS 选择器在一次设置后是免费的。
那还是便宜的模型。换成 Claude Sonnet 4.6 (输入 3 美元,输出 15 美元),账单就会翻倍 (PE Collective, 2026)。换成推理模型,取决于它在回答前思考多久,还要加上 3 到 10 倍的惩罚性成本。
这还不包括失败的情况。3% 到 5% 的幻觉率听起来无害,直到你算一笔账。每天 10 万个网页,这意味着会有 3000 到 5000 条错误记录流入你的数据仓库,看起来与正确的记录一模一样,因为模型自信地返回了它们。正如 DataHen 所说:"并不是 AI 有时会出错。而是它自信地出错。"(DataHen, 2026)。
经验丰富的团队实际的做法
阅读那些真正在生产环境中运行爬虫的供应商文档,模式是一致的:混合模式。使用 LLM 分析一次网页,然后运行廉价的确定性代码来处理后续的所有内容。
Zyte 在他们自己的文档中明确指出:"不要每页都使用 LLM,而是让 LLM 根据第一页的原始 HTML 为所需字段生成 CSS 选择器,并使用这些选择器来解析所有其他页面。"(Zyte LLM guide, 2026)。Apify 在他们的 2026 指南中推荐了相同的流程:先尝试 CSS 选择器,失败时再回退到 LLM (Apify 2026 guide)。DEV Community 上的生产部署记录准确地捕捉了这一架构:缓存的选择器路径不花钱,LLM 仅在验证失败时触发 (DEV.to, 2026)。
所以生产环境的分工如下:
- LLM 引导生成选择器 (每个目标调用一次,成本不到一美分)
- 选择器在每个页面上运行 (免费)
- 验证器 (通常是正则或存在性检查) 捕获偏差
- 偏差触发重新引导,发生在几周或几个月后
每页成本从大约 0.005 美元骤降到远低于 0.0001 美元。质量提高,因为确定性解析不会产生幻觉。而且你将 tokens 花在 LLM 真正擅长的工作上:读取新颖的结构,而不是复述你已经映射过的结构。
LLM 何时仍然物有所值
这不是一篇反 LLM 的文章。有很多提取任务正是模型适用的场景,且成本也是划算的:
- 每周都在变化的不稳定布局。 选择器每个周二都会坏掉,在工程时间上的成本高于 LLM 提取花费的 tokens。运行模型即可。
- 你再也不会访问的长尾目标。 编写选择器没有回报。运行模型即可。
- 输出本身就是摘要的非结构化内容。 从职位描述到技能,从文章到声明,从评论到情感。选择器帮不上忙。运行模型即可。
- 包含散布在各种布局变体中的可选字段页面。 带有二十个条件渲染的单一模板,正是 LLM 击败正则链的地方。
检查你的流水线。按请求量对目标进行排序。请求量前 20% 的目标几乎总是具有稳定的结构 (这就是它们成为前 20% 的原因,你是经过深思熟虑才集成它们的)。它们是选择器的候选者。长尾目标才是模型发挥作用的地方。
这对你的技术栈意味着什么
2026 年的供应商宣传希望你默认使用 LLM 提取。在小型项目上,积分定价让这看起来很合理。当你扩大规模时,它就不再合理了,就像当底层信号中断时,proxy 池大小不再能预测真正的成功一样。
构建实际流水线的团队有三个要点:
- 将获取与解析分离。 如果你的抓取供应商仅返回 LLM 提取的 JSON,当收到账单时你就无法回退到选择器。选择能够提供 HTML 并允许你选择提取路径的基础设施。
- 在选择器层面积极缓存。 生成的选择器可以在数千个页面中重复使用。昂贵的调用在于生成,而不是使用。
- 衡量每条记录的成本,而不是每页成本。 一条成本为每页 0.001 美元但产出 5% 坏记录的流水线,比一条成本为每页 0.005 美元但产出干净数据的流水线成本更高。存储、下游查询和最终的清理都有成本。
选择枯燥的一半
默认使用 LLM 提取非常适合演示,但完全不适合生产环境。做对的团队是那些将 LLM 视为理解页面的工具,而不是读取页面的工具。在 2026 年,枯燥的确定性代码在数量上仍然获胜;模型在应对新颖性上获胜。两者都在技术栈中有一席之地。
在 FourA,Single 和 Browser 返回原始响应 (HTML、渲染后的 DOM、headers、body) 后即止。无论你使用选择器解析、将其发送给模型,还是两者兼做,都由你决定。我们不会为没有做的提取附加积分乘数。