전체 글

검색, 에이전트, 학습: 웹의 새로운 봇 규칙

Cloudflare가 이제 동작이 아닌 목적(검색, 에이전트, 학습)에 따라 봇을 분류합니다. 9월 15일 기본값은 우려했던 것보다 범위가 좁으며, 체크박스 하나가 빠져 있습니다.

웹은 이제 동작이 아닌 목적으로 봇을 분류합니다

지난 15년 동안 구축된 모든 안티봇 시스템은 한 가지 질문을 던졌습니다. 이 트래픽이 자동화된 것처럼 보이는가? 헤더 순서, 통신 레벨 지문, 마우스 움직임, 세션 타이밍 등 모든 요소가 request 형태를 통해 클라이언트의 특성을 추론하려고 합니다.

2026년 7월 1일, Cloudflare는 이 질문을 바꾸었습니다. 이제 봇 트래픽은 실제 네트워크상에서 보이는 request 형태와 무관한 세 가지 카테고리로 분류됩니다. Search는 "나중에 질문에 답하기 위해 콘텐츠를 색인하는 크롤러"를 포함합니다. Agent는 "개인을 대신해 실시간으로 동작하는 자동화 활동"을 포함합니다. Training은 "모델을 훈련하거나 파인튜닝하기 위해 콘텐츠를 가져가는 크롤러"를 포함합니다.

동일한 서버에 세 개의 request가 도달하는 상황을 상상해 보십시오. 동일한 클라이언트, 동일한 헤더, 동일한 타이밍을 가지며 바이트 단위까지 완전히 일치합니다. 이 모델에서는 페이지를 수신한 후 무엇을 할 계획인지에 따라 완전히 다른 세 가지 판정을 받을 수 있습니다.

이것은 더 나은 탐지기가 아닙니다. 완전히 다른 프리미티브입니다.

9월 15일 마감 기한은 패닉에 비해 범위가 좁습니다

개발자 포럼에 퍼진 이야기는 Cloudflare가 9월 15일에 웹의 5분의 1에 걸쳐 AI 에이전트를 차단한다는 내용이었습니다.

변경 로그에는 훨씬 제한적인 내용이 적혀 있습니다. 새로운 기본 설정은 "Cloudflare에 새로 온보딩하는 도메인"에 적용됩니다. 해당 도메인에서는 "Training 또는 Agent로 분류된 봇이 광고를 표시하는 페이지에서 차단되며, Search는 허용 상태를 유지합니다." 이미 Cloudflare를 사용 중인 모든 사용자는 자체 설정을 직접 선택할 수 있으며, 해당 날짜 이전 언제든지 변경할 수 있습니다.

즉 신규 도메인에만 해당하고, 광고가 포함된 페이지만 해당하며, 세 가지 카테고리 중 하나는 여전히 기본적으로 통과합니다. 이는 실질적인 변화이지만 인터넷 전체를 가로막는 장벽은 아닙니다.

하지만 범위가 좁다는 점이 핵심입니다. Cloudflare는 정책을 발표한 것이 아니라 기본값을 발표했으며, 기본값은 누구의 투표 없이도 정책이 표준으로 자리 잡게 만드는 방식입니다. 주목해야 할 수치는 9월 15일이 아닙니다. 해당 도메인 중 이후 설정을 전혀 건드리지 않는 비율이 얼마인지가 핵심입니다.

시사점: 데이터를 수집하는 입장이라면, 실질적인 질문은 이제 "이 사이트의 보호를 뚫을 수 있는가"에서 "이 사이트가 나를 어떤 카테고리로 판단하는가"로 바뀌었습니다. 둘은 서로 다른 답을 가지며, 직접 테스트해 볼 수 있는 것은 후자뿐입니다.

목적은 측정할 수 없습니다. 선언되어야 합니다.

의도에 따라 트래픽을 분류할 때 발생하는 기계적 문제는 패킷 내에 의도가 담겨 있지 않다는 점입니다.

핑거프린트는 측정할 수 있습니다. 마우스 움직임도 측정할 수 있습니다. 하지만 "이 페이지를 왜 가져오는가"는 측정할 수 없습니다. 따라서 시스템은 클라이언트가 이를 직접 밝히도록 요구하고, 그 답변을 신뢰할 근거를 필요로 합니다. 그것이 바로 Web Bot Auth가 하는 역할입니다. 에이전트는 프라이빗 키로 request에 서명하고, 키 디렉터리를 공개하며, 엣지는 RFC 9421 HTTP Message Signatures 기반으로 해당 서명을 검증합니다. Cloudflare 문서는 검증된 봇의 기준을 "정직한 자체 식별"로 규정합니다.

이제 대규모 환경에서 이를 강제하는 주체를 살펴보겠습니다. 해당 규격은 draft-meunier-webbotauth-httpsig-protocol-02이며, 마지막 개정일은 2026년 8월 18일입니다. 목표 상태는 표준 트랙(Standards Track)입니다. 실제 상태는 "IETF가 승인하지 않았으며" "IETF 표준화 프로세스에서 어떠한 공식적 지위도 갖지 않는" "개인 활성 인터넷 초안(Active Internet-Draft (individual))"입니다. 저자는 두 명입니다. 한 명은 Cloudflare 소속이고, 다른 한 명은 Google 소속입니다.

우리는 이 설계 방향이 옳다고 생각하며, 비판에 앞서 이 점을 먼저 짚고 넘어갈 필요가 있습니다. 규칙을 준수하려는 대상에게는 서명된 신원이 CAPTCHA와의 군비 경쟁보다 낫습니다. 스스로를 식별하는 크롤러는 추측에 의존하는 대신 의도에 따라 허용, 속도 제한 또는 과금 처리를 할 수 있으며, 사이트 소유자는 실제 방문자에게 부수적 피해를 주지 않는 통제권을 얻습니다. 지난 10년간 IP 대역을 차단하며 기도하던 방식과 비교해 보십시오.

하지만 이 방식이 누군가를 강제로 막을 수는 없습니다. 선언된 목적을 기반으로 구축된 시스템은 스스로를 선언한 트래픽만 분류할 뿐입니다. 그 외의 모든 트래픽은 기존에 존재하던 탐지 스택으로 넘어가며, 그 스택은 계속해서 정교해지고 있습니다. Cloudflare의 세션 범위 행동 스코어링은 새로운 카테고리가 도입된 지 12일 만에 출시되었습니다.

따라서 두 가지는 경쟁 관계가 아닙니다. 신원 인증은 정직한 트래픽을 분류하고, 탐지 스택은 그 외의 모든 트래픽을 처리하며, 아무것도 선언하지 않은 트래픽은 기본적으로 후자에 도달하게 됩니다.

공개 데이터 수집을 위한 분류는 없습니다

이제 데이터 수집 파이프라인을 운영하는 사람이라면 누구나 신경 쓰일 법한 부분입니다.

올해 당사가 공개한 작업을 예로 들어보겠습니다. 공개 리스팅을 기반으로 구축한 목재 가격 지수, 6개 마켓플레이스에서 동일한 제품 페이지를 서로 다른 6개의 관점에서 가져와 내용을 비교하는 MAP 위반 탐지, 앱 스토어 순위 및 리뷰 감성 분석, 그리고 캠페인이 실제로 집행된 국가에서 실행한 광고 게재 위치 확인이 있습니다.

이것들을 Search, Agent, Training 중 어디로 분류해야 할까요?

Search는 맞지 않습니다. Cloudflare의 정의에 따르면 "추천 트래픽이나 그에 상응하는 공정한 대가 제공"이라는 기대 조건이 붙는데, 야간에 실행되는 가격 확인 작업은 누구에게도 추천 트래픽을 보내지 않기 때문입니다. Agent 역시 맞지 않습니다. 화면 앞에 앉아 해당 fetch 결과를 기다리는 사람이 없기 때문입니다. 그리고 Training은 명백히 오답입니다. 어떤 데이터도 모델에 흡수되지 않기 때문입니다.

이것은 지난 3년 동안 등장한 AI 트래픽을 설명하기 위해 작성된 분류 체계이며, 현재 이보다 10년 앞서 시작된 비즈니스에 적용되고 있습니다. 가격 인텔리전스, 대체 데이터, SERP 추적, 브랜드 보호, 광고 검증, 컴플라이언스 모니터링은 전혀 새로운 것이 아니고, 에이전트 기반도 아니며, 체크할 수 있는 선택지도 없습니다.

선택지가 없는 트래픽은 그 분류 기준을 만든 주체에 의해 분류됩니다. 보통 가장 가까운 항목으로 강제 배정됩니다.

데이터 팀에 이것이 의미하는 바

규칙이 아직 확정되지 않은 지금 시점에 실행할 가치가 있는 4가지 작업입니다.

솔직하게 주장할 수 있는 카테고리를 결정하십시오. 단순히 진입하기 유리한 카테고리가 아니라, 퍼블리셔가 직접 물었을 때 서면으로 방어할 수 있는 카테고리여야 합니다. 솔직한 답변이 "이 중 어느 것도 아님"이라면, 여러분은 분류 체계가 굳어졌을 때 가장 큰 손실을 입을 그룹이자, 논의의 여지가 있을 때 이를 명확히 밝혀 가장 큰 이득을 얻을 수 있는 그룹에 속해 있습니다.

헤드라인이 아니라 대상 사이트의 설정을 확인하십시오. 이제 사이트의 bot 정책은 해당 사이트의 고유 속성이며, 경로별로 구성 가능하고, 예고 없이 변경됩니다. "Cloudflare가 9월에 에이전트를 차단한다"는 소식을 파이프라인에 적용되는 기정사실로 취급하면, 전혀 위험하지 않았던 시스템까지 재구축하게 됩니다.

광고 페이지 테스트가 확산될 것으로 가정하십시오. Cloudflare는 기본 설정을 광고를 표시하는 페이지에 연결했습니다. 이는 "이 페이지가 사람의 주의 집중을 통해 수익을 창출한다"는 점을 가늠하는 유효한 proxy입니다. 이 기준선은 이동할 것이며, Cloudflare만 이를 정의하고 있는 것은 아닙니다. AWS WAF는 2026년 6월 15일에 402 코드 및 기계 판독 가능한 결제 조건으로 응답하는 AI traffic monetization 기능을 출시했습니다. Akamai는 TollBit 및 Skyfire와의 파트너십 방식을 택했습니다. 최대 규모의 엣지 제공업체 중 세 곳이 이제 동일한 제어 수단을 판매하고 있으며, 당사는 크롤링당 지불(pay-per-crawl) 모델이 출시되었을 때 이를 가격 책정 측면에서 살펴본 바 있습니다.

데이터 수집 시스템이 두 방식 모두에서 작동할 수 있도록 유지하십시오. 식별되는 방식(서명, 선언, 허용 또는 청구 수용)과 식별되지 않는 방식(이전처럼 동작을 기준으로 평가받음)은 앞으로 수년간 공존할 것입니다. 어느 한쪽만 존재한다고 가정하고 시스템을 구축하는 것은 양방향 모두에서 비용이 크게 드는 실수가 됩니다.

분류 기준은 다시 정의될 것입니다

우리가 자신 있게 내놓는 예측입니다. 1년 이내에 네 번째 카테고리가 등장할 것입니다.

모든 분류 체계의 첫 번째 버전은 압박을 받는 측에 의해 작성되며, 분류 대상이 되는 이들은 그 자리에 함께하지 못합니다. Search, Agent, Training은 AI 기업이 퍼블리셔를 상대로 수행하는 작업을 설명합니다. 시장 조사 기업, 컴플라이언스 팀, 경쟁사의 가격을 모니터링하는 유통업체의 작업은 설명하지 못하며, 이 세 주체는 "agent"라는 용어가 이러한 맥락에서 쓰이기 훨씬 전부터 정중하게 공개 페이지를 수집해 왔습니다.

그 네 번째 항목을 무엇이라 부르고 누가 이를 선택할 권한을 가질 것인지에 대한 논쟁은, 올해 발표된 그 어떤 안티봇 벤치마크보다 데이터 업계에 더 중요하게 작용할 것입니다. 이는 직접 참여할 가치가 있는 논쟁입니다.

대비책은 명확하기 때문입니다. 사용자의 트래픽을 직접 정의하지 못한다면, 다른 누군가가 대신 정의할 것입니다.