1月の1600万リクエストが証明したIPブロックの終焉
2026年1月、大手Eコマースプラットフォームが買い占め攻撃を受けた。390万の固有IPアドレスから1600万のリクエストが分散して送信された。IP単位のレート制限は全く機能しなかった。この攻撃はコードが巧妙だったから成功したわけではない。圧倒的なIP数により、従来の検知が無意味化したため成功したのだ(SecurityBoulevard, March 2026)。
この事件は、アンチボット業界が以前から主張していたことを証明した。IPレピュテーションだけでは人間とボットを区別できないということだ。防御側が進化している以上、スクレイパー側も進化する必要がある。
IPブロックに代わる3つのレイヤー
現代のボット検知は3つのレイヤーで機能する。IPが関係するのは最初の1つだけだ。
接続フィンガープリンティング。 リクエストがサーバーに到達する前に、接続の最初のパケットが、リクエストを行うHTTPライブラリを特定する独特な形状を伝える。Pythonのrequestsライブラリ、Goのデフォルトクライアント、Node.jsのfetch。それぞれが独自のフィンガープリントを生成する。アンチボットシステムは、単一のヘッダーを読み込む前にこれを確認する。シグネチャが実際のブラウザと一致しない場合、接続レベルでブロックされる(Reddit r/programming)。
ブラウザフィンガープリンティング。 現在、サイトはブラウザ環境から300以上のシグナルを確認している。Canvasレンダリング、WebGL出力、オーディオコンテキスト、インストール済みフォント、画面解像度、タイムゾーン、GPU情報などだ。User-Agent文字列は、スタックの中で最も重要ではないシグナルである。Cloudflare、Akamai、DataDomeは、ページ読み込み前に実行されるJavaScriptチャレンジを通じてこれらを受動的に収集する(ScrapingBee, 2026)。
行動分析。 これは最も新しいレイヤーであり、偽装が最も困難である。アンチボットシステムは現在、マウスの動き、スクロール速度、クリックパターン、タイピングのリズム、インタラクション間のタイミングを追跡している。実際の人間はマウスを完全に直線的に動かすことはない。一時停止したり、ボタンを行き過ぎたり、不規則にスクロールしたりする。ボットはこれらの動作を一切行わないか、すべてを完璧に行いすぎる(r/webdev, 2026)。
多くのスクレイピングチームが間違った戦いをしている
不都合な真実がある。ほとんどのスクレイピングチームは、依然としてIPインフラストラクチャに主に投資している。より大規模なプロキシプール、住宅用IP、ローテーティングゲートウェイなどだ。それらにも用途はある。IPレピュテーションは依然として多くのシグナルの一つとして重要である。
しかし、接続レベルのフィンガープリントが「Pythonスクリプト」であることを露呈していたり、headlessブラウザがnavigator.webdriverを介して自動化フラグを漏らしていたりする場合、10,000個の住宅用IPを購入しても意味がない。間違ったレイヤーに資金を費やしていることになる。
本番環境用のスクレイパーを34個構築した開発者が、この問題について執筆している(Dev|Journal, March 2026)。チュートリアルレベルのスクレイピングと本番環境で機能するものの間にあるギャップは、DOMセレクタではなく、接続フィンガープリントとマウスの動きを分析するアンチボットシステムによって定義される。チュートリアルではHTMLの解析を学ぶ。本番環境では検知を生き残る方法を学ぶのだ。
そして状況は悪化している。BrowserlessのState of Web Scraping 2026レポートによると、アンチボットシステムがheadlessブラウザと通常のブラウザインスタンス間の特定のフィンガープリントの違いをカタログ化しているため、標準のheadlessブラウザは実際のブラウザよりも頻繁にフラグを立てられることがわかった。このギャップは縮まっていない。
もしあなたのスクレイパーが壊れ続け、プロキシのローテーションしか見ていないのなら、全く見当違いの修正をしている可能性がある。
Cloudflareという要因
Cloudflareは特筆に値する。彼らはこの変化の両側に位置しているからだ。
彼らのBot Management製品は、すべてのリクエストに対して行動分析を実行し、数十のシグナルに基づいて訪問者を1から99のスケールでスコアリングする。Turnstile(彼らの目に見えないCAPTCHAの代替)は、訪問者がどれだけ人間に見えるかに基づいて、チャレンジの難易度を動的に調整する(Cloudflare docs)。
同時に、Cloudflareは独自のAIクローリングインフラストラクチャを立ち上げた。コミュニティはその皮肉に気づいている(Reddit r/cybersecurity)。
これが実質的に意味すること。Cloudflareで保護されたサイトは2026年において最もスクレイピングが困難であり、全ウェブサイトの約20%が同社のネットワークの背後にある。行動検知を考慮しないスクレイピング戦略をとるならば、アクセス可能なウェブの5分の1を失ったことになる。
2026年に実際に機能するもの
成功するスクレイパーには3つの共通する特徴がある。
1つ目は、最新のブラウザのワイヤレベルのシグネチャと一致していることだ。接続の実際のバイトレベルの形状が、最新のChromeやFirefoxセッションが出力するものと一致している必要がある。ヘッダーの偽装をどれだけ行っても、一致しない接続フィンガープリントは修正できない。
2つ目は、実際の(または説得力のある実際の)ブラウザ環境を実行していることだ。デフォルト設定のheadlessインスタンスではない。名乗っているUser-Agentと一致する一貫したフィンガープリントを持つ、実際のブラウザインスタンスである。
3つ目は、保護されたサイトに対して、人間のような行動ノイズを追加することだ。ランダムな遅延だけでは不十分である。アクション間のタイミングは現実的な分布に従う必要があり、マウスの移動経路には有機的に見える曲線やためらいが必要である。
そのため、アーキテクチャはシフトした。より多くのIPを持つことではない。各リクエストを、実際のブラウザを閲覧している実際の人間と区別できないようにすることなのだ。
検知の軍拡競争は加速している
アンチボットベンダーは、顧客ベース全体で脅威インテリジェンスをリアルタイムに共有し始めている。あるサイトが新しいボットパターンにフラグを立てると、ネットワーク内の他のすべてのサイトが数分以内に学習する(SecurityBoulevard, March 2026)。これは、各サイトの防御が独立して機能していた古いモデルからの根本的な変化である。
これは、自社構築のスクレイピングインフラストラクチャのコストが上昇し続けることを意味すると我々は考えている。新しい検知シグナルごとに、対抗するためのエンジニアリング時間が必要となり、そのサイクルは加速している。インフラストラクチャレベルでの検知(スマートプロキシルーティング、ブラウザフィンガープリンティング、接続レベルのマッチング)を処理するチームは、IPを投入し続けるチームを凌駕するだろう。
重要なのは、より多くのプロキシが必要かどうかではない。ターゲットサーバーに到達する前に、リクエストが人間に見えるかどうかである。