Webはボットを行動ではなく目的で分類し始めている
過去15年間に構築されたすべてのボット検知システムは、ある1つの問いを投げかけてきました。このトラフィックは自動化されたものに見えるか? ヘッダーの順序、ワイヤレベルのフィンガープリント、マウスの動き、セッションのタイミング。そのすべてが、リクエストの形状からクライアントの正体を推測しようとするものです。
2026年7月1日、Cloudflareはその問いを変えました。ボットトラフィックは現在、ネットワーク上のリクエストの見た目とは無関係な3つのカテゴリに分類されます。「Search」は「後で質問に答えるためにコンテンツをインデックスするクローラー」を対象とします。「Agent」は「ユーザーの代わりにリアルタイムで動作する自動化されたアクティビティ」を対象とします。「Training」は「モデルのトレーニングやファインチューニングのためにコンテンツを取得するクローラー」を対象とします。
同じサーバーに3つのリクエストが届く様子を想像してください。同一のクライアント、同一のヘッダー、同一のタイミングで、バイト単位まで完全に一致しているとします。このモデルでは、ページを取得した後に何を意図しているかによってのみ、3つの異なる判定が下される可能性があります。
これは検知機能の改善ではありません。根本的に異なるプリミティブです。
9月15日の期限は騒がれているほど広範囲ではない
開発者フォーラムで広まっている言説では、Cloudflareが9月15日にWebの5分の1でAIエージェントをブロックする、とされています。
しかし、更新履歴に書かれている内容ははるかに限定的です。新しいデフォルト設定は「Cloudflareに新規登録されるドメイン」にのみ適用されます。これらのドメインでは、「広告を表示するページにおいて、TrainingまたはAgentに分類されたボットはブロックされ、Searchは引き続き許可される」となります。すでにCloudflareを利用しているすべてのユーザーは自身で設定を選択でき、その期日前の任意のタイミングで変更可能です。
つまり、新規ドメイン限定、広告掲載ページ限定であり、3つのカテゴリのうち1つはデフォルトで通過します。これは実質的な変更ではありますが、インターネット全体を遮断する壁ではありません。
しかし、範囲が狭いことこそが興味深い点です。Cloudflareはポリシーを公開したのではなく、デフォルト値を公開しました。そしてデフォルト値とは、誰も投票することなくポリシーを業界標準へと変える手段です。注視すべきなのは9月15日という日付ではありません。その後、それらのドメインのうちどれだけが設定を変更しないままでいるかです。
これが意味すること: データを収集している場合、有用な問いは「このサイトの保護を突破できるか」ではなく、「このサイトは自分をどのカテゴリとみなしているか」に変わりました。これらは答えが異なり、テストによって検証できるのはそのうちの1つだけです。
目的は計測できない。宣言される必要がある。
意図に基づいてトラフィックを分類する際の技術的な問題はここにあります。パケットの中に意図は含まれていません。
フィンガープリントは測定できます。マウスの動きも測定できます。しかし「なぜこのページを取得しているのか」は測定できません。そのため、システムはクライアント自身にそれを明示させ、その回答を信用できる根拠を必要とします。それがWeb Bot Authの役割です。エージェントは秘密鍵でrequestに署名し、公開鍵ディレクトリを公開します。エッジはRFC 9421 HTTP Message Signaturesに基づいてその署名を検証します。Cloudflareのドキュメントでは、検証済みbotの基準を「正直な自己申告」としています。
では、これを大規模に適用している実態を見てみましょう。仕様はdraft-meunier-webbotauth-httpsig-protocol-02で、最終改訂日は2026年8月18日です。意図されたステータスはStandards Trackですが、実際のステータスは「IETFによって承認されておらず」「IETF標準化プロセスにおける正式な地位を持たない」「Active Internet-Draft (individual)」です。著者は2名で、1名はCloudflare、もう1名はGoogleに所属しています。
批判に入る前に述べておくと、この設計自体は正しいと考えています。ルールを守る意思のある対象にとっては、署名されたアイデンティティの方が、検証ページによるいたちごっこよりも優れています。自己申告を行うクローラーであれば、推測に頼ることなく、意図的に許可、スロットリング、あるいは課金を行うことができ、サイト所有者は正規の訪問者を巻き添えにしない制御手段を得られます。これを、過去10年間のIPレンジブロックと神頼みの運用と比較してみてください。
不可能なのは、不正な主体の阻止です。申告された目的に依存するシステムは、自己申告するトラフィックしか分類できません。それ以外のトラフィックはすべて既存の検知スタックへとフォールバックします。そしてそのスタックは進化を続けており、Cloudflareのsession-scoped behavioral scoringは、新しいカテゴリが導入されてからわずか12日後にリリースされました。
つまり、この2つは競合していません。アイデンティティは正直なトラフィックを分類し、検知はそれ以外を処理します。何も申告しなければ、トラフィックはデフォルトで後者に分類されます。
公開データ収集に当てはまる枠が存在しない
ここからが、データ収集パイプラインを運用しているすべての人が懸念すべき点です。
今年当社が公開した事例を取り上げてみます。公開リスティングから構築された木材価格指数。6つのマーケットプレイスにまたがるMAP違反検知(同一の製品ページを6つの異なる視点から取得して表示内容を比較する処理)。アプリストアのランキングとレビューのセンチメント分析。キャンペーンが実際に配信された国から実行する広告掲載確認。
これらを、Search、Agent、Trainingのいずれかに分類してみてください。
Searchには当てはまりません。Cloudflare自身の定義では「見返りとしてのリファラルトラフィック、またはその他の公平な対価」が期待されていますが、夜間の価格チェックが誰かにリファラルを送ることはありません。Agentも該当しません。そのフェッチの結果を画面の前で待っている人間はいないからです。そして、モデルに何も取り込まれないため、Trainingでないことは明白です。
これは過去3年間に現れたAIトラフィックを説明するために作られた分類法であり、それが10年前から存在するビジネスに適用されています。価格インテリジェンス、オルタナティブデータ、SERP追跡、ブランド保護、広告検証、コンプライアンス監視など、これらは新しいものでも、agenticなものでもなく、該当するチェックボックスも存在しません。
チェックボックスのないトラフィックは、その分類枠を引いた者によって分類されます。通常は、最も近い枠の中に押し込められます。
データチームにとっての意味
ルールがまだ流動的なうちに実行すべき4つの事項があります。
自社が率直に主張できるカテゴリを判断する。 アクセスを通すためのカテゴリではなく、パブリッシャーから直接問われた際に書面で弁明できるカテゴリです。率直な答えが「どれにも該当しない」であるなら、分類法が固定化したときに最も多くを失うグループであり、まだ議論の余地がある今のうちにそれを表明することで最も多くを得られるグループに属しています。
ヘッドラインではなく、ターゲットの設定を読む。 サイトのボットポリシーは現在そのサイト自身のプロパティであり、パスごとに設定可能で、予告なしに変更されます。「Cloudflareが9月にエージェントをブロックする」という話をパイプラインの確定事項として扱うと、リスクにさらされていなかったものまで再構築することになります。
広告ページの判定基準が普及すると想定する。 Cloudflareはデフォルトの基準を広告が表示されるページに紐付けました。これは「人間のアテンションから収益を得ているページ」の適切な指標です。その境界線は今後変化し、それを引いているのはCloudflareだけではありません。AWS WAFは2026年6月15日にAI traffic monetizationをリリースし、402レスポンスと機械可読な支払い条件で応答するようになりました。AkamaiはTollBitおよびSkyfireとの提携ルートを選択しました。最大手のEdgeプロバイダー3社が現在同じコントロールサーフェスを販売しており、これについてはpay-per-crawlのローンチ時に価格設定の観点から考察しました。
どちらのレーンでも収集が機能する状態を維持する。 識別されるレーン(署名し、宣言し、許可されるか課金される)と、識別されないレーン(従来通り動作に基づいて判定される)は、今後何年も共存します。どちらか一方しか存在しない前提で構築することは、どちらの方向であってもコストのかかる過ちです。
分類枠は描き直される
私たちが責任を持って提示できる予測は、1年以内に4番目のカテゴリが登場するということです。
あらゆる分類体系の初期バージョンは、その時プレッシャーに晒されている者によって作られ、分類される側の当事者はその場に居合わせません。Search、Agent、Trainingという分類は、AI企業がパブリッシャーに対して行う行為を表しています。しかしこれらは、市場調査会社、コンプライアンスチーム、競合の店頭価格を調査する小売業者には当てはまりません。これら3者は、この文脈で「Agent」が意味を持つようになるずっと前から、公開ページを適切に取得してきました。
その4つ目の分類が何と呼ばれ、誰がそこにチェックを入れられるのかを巡る議論は、今年公開されたどのbot検出ベンチマークよりもデータ業界にとって重要です。それには参加する価値があります。
代償は明白だからです。もし自身のトラフィックを自ら定義できなければ、他の誰かが勝手に定義することになります。