AI学習データの無法地帯は終わりを迎えつつある
2025年半ば、AI関連のWebトラフィックの75%は学習データの収集によるものでした(Bright Data経由Cloudflare Radar、2025年)。推論でも検索でもなく、学習です。次世代モデルに供給するためにクローラーがページをスクレイピングしていました。
その時代は終わりつつあります。
ここ6ヶ月で3つの要因が重なりました。EU AI法の透明性要件がドラフト段階から施行段階へと移行しました。各サイトがAIクローラーの大規模ブロックを開始し、その割合は2023年9月の23%から2025年後半には信頼性の高いドメインの60%に達しました(Ars Technica、2025年)。そして、学習データの購入者がデータソースについて新たな疑問を投げかけ始めました。
スクレイピングしたデータを使ってモデルを学習させるプロダクトを構築しているなら、大半のチームがまだ織り込んでいない問題に直面することになります。
EU AI法が実際に要求していること
2026年の施行により、AI学習データソースに対する透明性要件が導入されます(Scaleviseの概要、2026年)。汎用AIモデルのプロバイダーは、モデルに投入されたデータの概要を公開する必要があります。著者や権利者はオプトアウトが可能であり、そのオプトアウトはモデル学習レイヤー(この段階では手遅れです)ではなく、データ収集レイヤーで尊重されなければなりません。
実務上、調達チェックリストには以下の3点が記載されるようになります。
- クロールしたサイト、日時、許諾内容に関する公開記録
- robots.txtおよび明示的なオプトアウトシグナルを遵守する仕組み
- 2年後の監査にも耐えうるデータ系統管理(データリネージ)
しかし、ここに落とし穴があります。何をどこから取得したのか把握していないパイプラインに、コンプライアンスを後付けすることはできません。スクレイピングをサイドプロジェクトとして構築したチームは、「サイドプロジェクト」と「監査対応可能」が両立しない現実に直面することになります。
つまり、ベンダー選定には今後「データ収集パートナーはクリーンな監査証跡を提示できるか」という設問が含まれるようになります。2024年の時点では大半のチェックリストにありませんでしたが、2026年第3四半期までにはすべての本格的なチェックリストに必須となります。
データブローカー選定の難易度が上昇
Bright Dataは年換算収益3億ドル以上、前年比50%以上の成長を報告しており、AI向けデータがその原動力であることを明言しています。コンプライアンスに準拠した学習データの市場が急拡大したのは、代替手段(必要なものを無差別にスクレイピングすること)のリスクが具体的に2つの点で高まったためです。
第1に、法的リスクの範囲が拡大しました。2026年2月に最高裁判所がBright Dataの特許申請を棄却し、同社の住宅用proxy特許2件が無効化されました。Oxylabsは反訴し、公判期日は2026年5月18日に設定されました。主張の正当性はともかく、データ収集手法をめぐる高額な訴訟が発生しています。これを注視する中小ベンダーも警戒を緩めていません。
第2に、技術的な対応範囲が拡大しました。Bot検知ベンダーは、顧客サイト間で脅威インテリジェンスをリアルタイムに共有し始めました。1つのECサイトでフラグが立ったスクレイピングパターンは、数時間以内に数百のサイトでブロックされる可能性があります (SecurityBoulevard, 2026)。安価なproxyをローテーションして運任せにする従来の運用法は、2025年後半には機能しなくなりました。この変化についてはbot detection went behavioralで解説しています。
総じて、トレーニングデータの自前収集にかかるコストは法的および技術的の両面で上昇しました。法的リスクが高まり、技術的難易度も上がっています。現在も自前収集を継続している企業は、多額のインフラ費用を投じるか、監査に耐えられないデータセットであることを受け入れるかの二者択一を迫られています。
2027年半ばまでの展望
今後18か月で、ベンダーの勢力図は次の3つの方向に再編されると考えています。
コンプライアンスが必須条件になる。 ISO 27001、SOC 2、GDPR準拠のプロセス、データリネージなどです。これらは差別化要因ではなく最低条件です。Bright DataはすでにISO 27001とSOC 2を取得しており、競合の多くは対応に追われています。本格的なAIプロダクトを提供するチームは、認証を提示できないデータ収集ベンダーの導入を拒否するようになります。
監査証跡が機能になる。 現在のほとんどのスクレイピングAPIはデータのみを返し、それ以外は破棄します。2027年までに、一定数の顧客が取得元URL、取得日時、レスポンスコード、取得時のrobots.txtの状態、オプトアウトの確認といった記録を求めるようになるでしょう。モデルの正当性が問われた際、こうしたメタデータがコンプライアンス上の防壁となります。
ベンダーの統合が加速する。 コンプライアンスのオーバーヘッドは規模の大きさに有利に働きます。月額69ドルのプランで存続している小規模なスクレイピングAPIは、上位市場へ移行するか、AIトレーニング関連の案件から排除されることになります。コンプライアンスと妥当な価格設定を両立する中堅ベンダーが、その需要を取り込むことになります。先月解説した「自作か購入か」のコスト比較は、自作側にとってさらに不利になりました。
エンジニアリングチームへの影響
今後12か月以内にAIプロダクトをリリースする場合、データソーシングの判断は単なるインフラの課題にとどまりません。法的リスクと市場参入に関わる課題となります。
現在のパイプラインに関して確認すべき3つのポイントは以下の通りです。
過去12か月間にクロールしたすべてのドメインを、タイムスタンプ付きでリストアップできますか? できない場合、基本的な監査を通過することはできません。
学習時ではなく、取得時にオプトアウト信号を尊重していますか? Robots.txtとX-Robots-Tagの対応はもはや任意ではありません。
データベンダーが明日規約を変更した場合、学習パイプラインは維持できますか? 多くのチームはこの点を検証していません。
今すぐ確認してください。まだ1年の猶予があると考えていた企業にも、最初の監査要求がすでに届き始めています。
私たちの見解
Compliance-by-design(設計段階からのコンプライアンス確保)は、単なるマーケティング文句ではありません。Webデータに依存するプロダクトを開発するチームにとって、生存を左右する決定事項です。今すぐデータリネージをP0機能として扱うチームは、2027年に直面する過酷な混乱を回避できます。単なる事務処理と見なすチームは、その事務処理こそが自社プロダクトと市場の間に立ちはだかる壁であることに、いずれ気づくことになります。
学習データの自由奔放な利用が終わりを告げようとしているのは、規制当局が敵対的だからではありません。不適切な対応による影響が「恥ずかしいブログ記事」から「欧州でのリリース不可」へと移行したためです。これにより、サプライチェーン全体の力学が変わります。