AI 训练数据随意抓取的时代正在终结
2025 年中,75% 的 AI 相关网络流量来自训练数据采集(Cloudflare Radar 引用自 Bright Data,2025 年)。不是推理,不是搜索,而是训练。爬虫不断抓取网页来喂养下一个模型。
那个时代即将结束。
过去六个月发生了三件事的交汇。欧盟《人工智能法案》(EU AI Act)的透明度要求从草案转为具备强制执行力。各大网站开始大规模拦截 AI 爬虫:截至 2025 年底,这一比例从 2023 年 9 月的 23% 飙升至 60% 的知名域名(Ars Technica,2025 年)。同时,训练数据的采购方开始对其数据来源提出新的审查要求。
如果你正在开发使用抓取数据来训练模型的产品,你面临的问题大多数团队目前还没有计算在成本之内。
欧盟《人工智能法案》的实际要求
2026 年推行的方案引入了针对 AI 训练数据源的透明度要求(Scalevise 总结,2026 年)。通用 AI 模型的提供商必须公开发布训练数据的摘要。作者和版权所有者可以选择退出(opt-out),并且这一退出机制必须在数据采集层得到遵守,而不是在已经太迟的模型训练层。
在实践中,采购核查清单上会出现三项内容:
- 你抓取了哪些网站、抓取时间以及在何种许可下的公开记录
- 遵守 robots.txt 和显式退出信号的机制
- 能够在两年后经受住审计的数据谱系(data lineage)
但关键问题在于:你无法将合规性硬套在一个根本不知道从哪里抓取了什么的数据管线上。那些把抓取当作边缘项目的团队很快就会发现,“边缘项目”与“可供审计”是互斥的。
这意味着:供应商选择现在包含了一个新问题:“你的数据采集合作伙伴能否提供干净的审计追踪记录?”。这个问题在 2024 年并未出现在大多数核查清单上。到 2026 年第三季度,它将出现在每一个严谨团队的清单中。
数据经纪商的考量变得更为复杂
Bright Data 报告了超过 3 亿美元的年化收入,同比增长超过 50%,并且他们明确表示 AI 数据是推动这一增长的核心引擎。合规训练数据市场呈现爆发式增长,因为另一种做法(随意抓取任何想要的数据)在两个具体方面变得风险极高。
首先,法律风险面扩大了。最高法院在 2026 年 2 月驳回了 Bright Data 的专利申请,其两项住宅 proxy 专利被宣告无效。Oxylabs 提起反诉,审判定于 2026 年 5 月 18 日进行。无论你对案情本身持何种看法,结果都是围绕数据采集方式展开的高昂诉讼。目睹这一切的小型厂商丝毫不敢松懈。
其次,技术对抗面扩大了。Bot 检测供应商开始跨客户站点实时共享威胁情报。在一个电商网站上被标记的抓取模式,可能在数小时内被数百个网站封禁(SecurityBoulevard, 2026)。轮换廉价 proxy 并寄希望于运气的旧策略,在 2025 年底前后的某个时间节点彻底失效了。我们在 bot detection went behavioral 中报道过这种转变。
综合来看:自建训练数据采集的成本在两个维度上都在上升。法律风险上升。技术难度上升。仍在自建采集的公司,要么在基础设施上投入重金,要么接受其数据集无法通过合规审计的现实。
到 2027 年年中的行业走向
我们认为未来 18 个月将通过三种方式重塑供应商格局。
合规成为入场门槛。 ISO 27001、SOC 2、符合 GDPR 的流程、数据血统。这些不再是差异化卖点,而是最低要求。Bright Data 已经拥有 ISO 27001 和 SOC 2 认证。其大多数竞争对手正在仓促跟进。交付严肃 AI 产品的团队将拒绝接入无法提供此类证书的数据采集供应商。
审计追踪成为核心功能。 目前大多数抓取 API 仅返回数据并丢弃其他一切。到 2027 年,相当一部分客户将需要完整记录:源 URL、抓取时间、response 状态码、抓取时的 robots.txt 状态、退出(opt-out)检查。当模型面临合规质疑时,这些枯燥的元数据将成为救命稻草。
供应商整合加速。 合规成本有利于具备规模效应的企业。依靠 69 美元/月套餐生存的小型抓取 API 要么走向高端市场,要么在涉及 AI 训练的交易中被彻底挤出。将合规性与合理定价相结合的中端供应商将接盘这些被转移的需求。我们在上个月分析过的自建与购买权衡,对自建方案而言变得更加不利。
这对工程团队意味着什么
如果你打算在未来 12 个月内交付 AI 产品,你的数据获取决策不再仅仅是基础设施问题。它们关乎法律风险,也关乎市场准入。
针对你当前的 pipeline,需要评估三件事:
你能否列出过去 12 个月内抓取过的所有域名及其时间戳? 如果不能,你连基础审计都无法通过。
你是否在抓取时就遵循退出信号,而不是等到训练阶段? Robots.txt 和 X-Robots-Tag 已经不再是可选项。
如果你的数据供应商明天变更条款,你的训练流水线还能维持吗? 大多数团队从未考虑过这一点。
因此请立即检查。第一批审计请求已经递交到了那些以为自己还有一年时间来解决这个问题的公司面前。
我们的立场
合规即设计(Compliance-by-design)不是一句营销口号。对于产品依赖网络数据的团队而言,这是一个关乎生存的决策。现在将数据血缘(data lineage)视为 P0 级特性的团队,将在 2027 年免于一场惨烈的被动应对。而将其视为文书琐事的团队终将发现,正是这些文书工作横亘在他们的产品与市场之间。
训练数据野蛮生长的时代之所以走向终结,并非因为监管机构刻意刁难。而是因为违规后果已经从“一篇令人尴尬的博文”升级为“产品无法在欧洲上线”。这改变了供应链上每一个环节的利害权衡。