← すべての記事

Pay-Per-Crawlがウェブを二分する

CloudflareのPay-Per-CrawlマーケットプレイスとHTTP 402は、ウェブをライセンスデータとオープンデータに二分します。2026年にウェブデータを収集するチームにとって何が変わるのかを解説します。

2026年2月19日、Stack OverflowとCloudflareは、Webデータ業界の多くが予期していなかった発表を行いました。両社はpay-per-crawl(クロール課金制)を共同発表しました。これは、AIクローラーがリアルタイムの402 Payment Requiredレスポンスを受け取り、パブリッシャーが設定した価格を支払うかアクセスを断念するかを選択するシステムです。ボットの身元はエッジで検証され、価格はサイト側が設定し、トランザクションは従量課金されます。

Cloudflareは、インターネット上の約5分の1のサイトの前段に位置しています。そのため、同社が既知のAIボットをデフォルトでブロックし、パブリッシャーがリクエストごとに課金できるマーケットプレイスを立ち上げたことで、オープンWebの大部分におけるアクセスモデルは週末のうちに変貌しました。

現在Webデータインフラを構築・運用しているなら、これは単なるCloudflareのニュースとして片付けられる話ではありません。「オープン」が意味するものの前提が変わります。

仕組みの詳細

技術的なアプローチ自体はシンプルです。Cloudflareは、長らく休眠状態だった「Payment Required」ステータスコードであるHTTP 402を復活させ、認証済みAIクローラーのレジストリと連携させました。パブリッシャーはリクエストごとの価格を設定します。クローラーはクレジット残高を保持して支払うか、ブロックされるかのいずれかです。

非技術的なインパクトはより大きいです。これまで「AI向けのコンテンツスクレイピングを禁止する」手段は、robots.txt(推奨規定であり強制力はない)とアグレッシブなボットブロッキング(二者択一で損失が多く、誤検知に満ちている)しかありませんでした。Cloudflareは第3の選択肢として「価格設定」を追加しました。

この第3の選択肢の経済性は、最初の2つとは異なります。robots.txtはコストがかかりませんが無視されます。ボットブロッキングは、ボットと誤判定された正規ユーザーのトラフィックを失うコストが発生します。価格設定は設計上、支払う意思のあるクローラーとそうでないクローラーを分離します。

実際に課金している対象

Stack Overflowがローンチパートナーとなったのは、同社のトレーニングデータに明確な価値があり、すでにOpenAIなどと個別契約を進めていたためです。Cloudflareのマーケットプレイスは、それらの個別契約を他のパブリッシャーも接続可能なレジストリへと汎用化しました。

これに追従する顔ぶれは急速に広がりました。AWSは独自のボットマネタイズ層を提供開始し、Akamaiも同様の仕組みを構築しました。パブリッシャーに対する提案は明快です。AIラボに対する費用のかかる訴訟の代わりに、リクエスト単位で収益を得るラインを構築できるというものです。

現時点でこれは主に高価値コンテンツ層(ドキュメント、ニュース、技術系Q&A、構造化された参照データ)に集中しています。Webのロングテール(小規模なECサイト、ローカル情報サイト、ニッチなフォーラム)にはこのようなゲートはなく、今後も導入されない可能性が高いです。Cloudflare自体のボット管理機能の利用にはコストがかかり、pay-per-crawlはオプトイン方式です。1回のページビューに課金する価値があるサイトでのみ成立します。

Webデータパイプラインへの影響

Stack Overflow、大手ニュースサイト、あるいは現在導入を進めているパブリッシャーからデータを取得するパイプラインを構築している場合、選択肢は3つに絞られます。トラフィックがAIクローラーとして識別された時点でマーケットプレイス経由で支払うか。提供されているライセンス済みデータセットへ切り替えるか。あるいは、まだオープンな場所からデータを探すかです。

多くのチームは、時期によってこれら3つすべてを使い分けることになるでしょう。それが現実的な落としどころです。ウェブはライセンス領域とオープン領域へと二分されつつあり、その境界はドメインごとに綺麗に引かれているわけではありません。同一のパブリッシャーであっても、あるセクションは402の背後にあり、別のセクションはオープンである場合があります。同じサイトが、特定のクローラーには課金し、研究用botは完全に無視することもあります。

エンジニアリングチームにとって現実的な対応は以下のようになると考えています。第1に、データソースの監査です。パイプラインの大部分がStack Overflow、Reddit、主要ニュースサイト、またはこうした契約を公に求めている多くのパブリッシャーから取得されている場合、今後12か月以内にアクセスモデルが変更されると想定してください。第2に、アーキテクチャ内部でライセンスソースとオープンソースを早期に分離することです。半数のソースが課金を始め、残りの半数が課金しない状況において、すべてのソースを同一に扱うパイプラインは脆弱です。第3に、robots.txtだけをシグナルとみなすのをやめることです。自社のクローラーがAIエージェントでなくても、402レスポンスは運用上の意味を持ちます。これほど新しいシステムにおいて、誤検知は避けられません。

これはEU AI法による学習データのコンプライアンス圧力と並行するものであり、すでに各チームは出所が追跡可能なソースへの移行を迫られています。クロール課金(Pay-per-crawl)は、その圧力に請求レイヤーが追加されたものに過ぎません。

率直な見解

いくつか注意すべき点があります。Cloudflareの身元確認は、botが登録していることを前提としています。登録しないbotや、レジデンシャル(住宅用)トラフィックに見えるbotは、402をまったくトリガーしません。代わりに通常のbot検知に引っかかります。これは、大半のアグレッシブなAIクローラーがすでに辿っている経路です。つまり、クロール課金は準拠する意思のあるbotに対してのみ機能します。準拠しないbotは、最初からrobots.txtを尊重するつもりもありません。

より大きな変化は、マーケットプレイスそのものではないかもしれません。「このコンテンツはAIの学習に利用可能か」という問いが、robots.txtからの推測ではなく、契約上の明確な答えを持つようになった点です。パブリッシャーはついに強制力を持ち、クローラーは確実に把握できるようになります。マーケットプレイスが及ぶ領域では、グレーゾーンが縮小します。

依然としてグレーなままなのは、その対象外にあるすべてです。Cloudflareを導入していない小規模サイト、AI戦略のない地域のアグリゲーター、誰も交渉の場につかないウェブのロングテールなどです。これらは402を返すこともなく、ライセンス契約を結ぶこともありません。対価の先例ができたことで抗議の声は大きくなるものの、以前のアクセスポリシーがそのまま維持されます。

今後の展望

2つの予測がありますが、これらは平穏なものではありません。

1つ目: 今後12か月で、非AI botを対象とした第2層のペイウォールが登場する見込みです。マーケットプレイスのメカニズムは、単なるHTTPステータスコードと課金レイヤーにすぎません。検索クローラー向け価格設定、アーカイブbot向け価格設定、競合監視向け価格設定への拡張は、技術的に難しくありません。パブリッシャーがAIクローラーのみへの課金にとどまるかどうかは、次の波がどう動くかにかかっています。大抵の場合、その境界線は崩れます。

2つ目: AI研究所はこれを迂回します。402を無視するのではなく (追跡可能であり訴訟対象となるため)、ライセンス供与されたデータセットを一括購入し、残りのすべてを実ユーザーのように見えるトラフィック経由で実行します。Cloudflareが行動検知機能を強化して提供しているのは、まさにこれを把握しているためです。FourAはその軍拡競争がセッションレベルのシグナルへと移行する様子を2年間見てきました。これはマーケットプレイスで終わる話ではありません。

ビルダーにとって興味深い問いは、支払うべきかどうかではありません。オープンなWebがどこで、いつまでオープンであり続けるかです。