웹은 이제 동작이 아닌 목적을 기준으로 봇을 분류합니다
지난 15년 동안 구축된 모든 봇 탐지 시스템은 한 가지 질문을 던졌습니다. 이 트래픽이 자동화된 것처럼 보이는가? Header 순서, 통신 레벨 지문, 마우스 움직임, 세션 타이밍 등 모든 요소는 request의 형태로부터 클라이언트에 대한 정보를 추론하려 합니다.
2026년 7월 1일, Cloudflare는 질문을 바꿨습니다. 이제 봇 트래픽은 request가 네트워크 상에서 어떻게 보이는지와 전혀 무관한 세 가지 카테고리로 분류됩니다. Search는 "나중에 질문에 답변할 수 있도록 콘텐츠를 인덱싱하는 크롤러"를 포함합니다. Agent는 "사용자를 대신하여 실시간으로 작동하는 자동화된 활동"을 다룹니다. Training은 "모델을 학습하거나 파인 튜닝하기 위해 콘텐츠를 가져가는 크롤러"를 다룹니다.
동일한 서버에 도착하는 세 개의 request를 상상해 보십시오. 동일한 클라이언트, 동일한 header, 동일한 타이밍, 바이트 단위까지 완벽하게 일치합니다. 이 모델에서는 페이지를 수신한 후 무엇을 할 계획인지에 따라 완전히 다른 세 가지 판정을 받을 수 있습니다.
이는 더 나은 탐지기가 아닙니다. 전혀 다른 프리미티브입니다.
9월 15일 마감 기한은 우려보다 제한적입니다
개발자 포럼에 퍼지고 있는 이야기는 Cloudflare가 9월 15일에 웹의 5분의 1에 걸쳐 AI 에이전트를 차단한다는 것입니다.
변경 로그에 적힌 내용은 훨씬 더 범위가 좁습니다. 새로운 기본값은 "Cloudflare에 새로 온보딩하는 도메인"에 적용됩니다. 해당 도메인에서는 "Training 또는 Agent로 분류된 봇이 광고를 표시하는 페이지에서 차단되며, Search는 허용 상태로 유지됩니다." 이미 Cloudflare를 사용하는 모든 사용자는 자체 설정을 선택할 수 있으며, 해당 날짜 이전 언제든지 변경할 수 있습니다.
정리하자면, 신규 도메인에만 해당되고, 광고가 포함된 페이지만 해당되며, 세 가지 카테고리 중 하나는 여전히 기본적으로 통과합니다. 이는 실질적인 변화이지만 인터넷 전체를 가로막는 벽은 아닙니다.
하지만 좁은 범위가 오히려 주목할 부분입니다. Cloudflare는 정책을 발표한 것이 아니라 기본값을 발표했으며, 기본값은 누구의 투표도 거치지 않고 정책이 표준으로 자리 잡는 방식입니다. 주목해야 할 숫자는 9월 15일이 아닙니다. 이후 얼마나 많은 도메인이 이 설정을 전혀 건드리지 않고 유지하는지입니다.
이것이 의미하는 바: 데이터를 수집하는 입장이라면, 유의미한 질문은 "이 사이트의 보호를 뚫을 수 있는가"에서 "이 사이트가 나를 어떤 카테고리로 인식하는가"로 바뀌었습니다. 두 질문의 답은 다르며, 테스트를 통해 검증할 수 있는 것은 후자뿐입니다.
목적은 측정할 수 없습니다. 선언되어야 합니다.
의도에 따라 트래픽을 분류할 때 발생하는 기계적인 문제는 다음과 같습니다. 의도는 패킷 안에 들어있지 않습니다.
핑거프린트는 측정할 수 있습니다. 마우스 움직임도 측정할 수 있습니다. 하지만 "왜 이 페이지를 가져오고 있는가"는 측정할 수 없으므로, 시스템은 클라이언트가 이를 직접 밝히도록 요구하고 그 답변을 신뢰할 만한 근거를 필요로 합니다. 이것이 바로 Web Bot Auth가 수행하는 역할입니다. 에이전트는 프라이빗 키로 request에 서명하고 키 디렉터리를 공개하며, 엣지는 RFC 9421 HTTP Message Signatures를 기반으로 해당 서명을 검증합니다. Cloudflare 문서는 검증된 봇의 기준을 "정직한 자체 식별"로 정의합니다.
이제 대규모 환경에서 이를 강제하는 주체를 살펴보겠습니다. 해당 규격은 2026년 8월 18일에 최종 개정된 draft-meunier-webbotauth-httpsig-protocol-02입니다. 목표 상태는 Standards Track입니다. 실제 상태는 "IETF의 승인을 받지 않았으며" "IETF 표준화 프로세스에서 공식적인 지위가 없는" "Active Internet-Draft (individual)"입니다. 저자는 두 명입니다. 한 명은 Cloudflare에서 근무하고, 다른 한 명은 Google에서 근무합니다.
본격적인 비판에 앞서 밝히자면, 우리는 이 설계 방향 자체는 옳다고 봅니다. 정상적으로 동작하려는 주체에게는 서명된 신원이 인증 페이지 기반의 소모전보다 훨씬 낫습니다. 스스로 신원을 밝히는 크롤러는 추측에 의존하는 대신 의도에 따라 허용하거나, 쓰로틀링하거나, 과금할 수 있으며, 사이트 소유자는 실제 방문자에게 부수적 피해를 주지 않는 제어 수단을 얻게 됩니다. 지난 10년간 IP 대역을 차단하며 기도하듯 운영하던 방식과 비교해 보십시오.
하지만 이 방식이 누군가를 강제로 막을 수는 없습니다. 선언된 목적을 기반으로 구축된 시스템은 스스로 선언한 트래픽만 분류할 수 있을 뿐입니다. 그 외의 모든 트래픽은 기존에 존재하던 탐지 스택으로 폴백되며, 그 스택은 갈수록 정교해지고 있습니다. Cloudflare의 세션 범위 동작 점수 산정(session-scoped behavioral scoring) 기능은 새 카테고리가 도입된 지 12일 만에 출시되었습니다.
따라서 두 방식은 경쟁 관계가 아닙니다. 신원은 정직한 대상을 분류하고 탐지는 그 외의 모든 대상을 처리하며, 아무것도 선언하지 않을 경우 트래픽은 기본적으로 후자에 도달하게 됩니다.
공개 데이터 수집을 위한 범주는 없습니다
이제 데이터 수집 파이프라인을 운영하는 사람이라면 누구나 고민해 보아야 할 부분입니다.
올해 우리가 발표한 작업들을 예로 들어보겠습니다. 공개 리스팅 데이터를 기반으로 구축한 목재 가격 지수가 있습니다. 6개 마켓플레이스에 걸친 MAP 위반 탐지는 동일한 제품 페이지를 6개의 서로 다른 관점에서 가져와 각각의 내용을 비교하는 작업입니다. 앱 스토어 순위 및 리뷰 감성 분석도 있습니다. 캠페인이 실제로 구매된 국가에서 실행한 광고 게재 위치 확인도 있습니다.
이러한 작업들을 Search, Agent, Training 중 어디로 분류해야 할까요?
Search는 맞지 않습니다. Cloudflare 자체 정의에 따르면 "그 대가로 추천 트래픽이나 기타 공정한 보상"을 기대한다고 되어 있지만, 매일 밤 실행되는 가격 확인 작업은 그 누구에게도 추천 트래픽을 보내지 않습니다. Agent 역시 맞지 않습니다. 해당 fetch 결과를 화면 앞에서 기다리는 사람이 없기 때문입니다. 그리고 모델에 어떤 데이터도 학습되지 않으므로 Training은 명백히 틀렸습니다.
이는 지난 3년 동안 나타난 AI 트래픽을 설명하기 위해 작성된 분류 체계이며, 이제 그보다 10년 앞서 시작된 비즈니스에 적용되고 있습니다. 가격 인텔리전스, 대체 데이터, SERP 추적, 브랜드 보호, 광고 검증, 컴플라이언스 모니터링 중 그 어떤 것도 새로운 것이 아니며, 에이전트 기반이 아니고, 체크할 수 있는 전용 항목도 없습니다.
해당하는 항목이 없는 트래픽은 기준을 만든 주체에 의해 임의로 분류됩니다. 보통 가장 가까운 항목으로 들어갑니다.
데이터 팀에 이것이 의미하는 바
규칙이 아직 확정되지 않은 지금 시점에 실행할 가치가 있는 네 가지 작업입니다.
솔직하게 주장할 수 있는 카테고리가 무엇인지 결정하십시오. 단순히 통과하기 위한 카테고리가 아닙니다. 퍼블리셔가 직접 질문했을 때 서면으로 방어할 수 있는 카테고리여야 합니다. 솔직한 답변이 "이 중 어느 것도 아님"이라면, 분류 체계가 굳어졌을 때 가장 큰 피해를 볼 수 있는 그룹에 속해 있는 것이며, 아직 논의의 여지가 있을 때 목소리를 내어 가장 큰 이득을 얻을 수 있는 그룹입니다.
헤드라인이 아니라 타깃의 설정을 확인하십시오. 이제 사이트의 봇 정책은 해당 사이트의 고유 속성이며, 경로별로 설정할 수 있고, 예고 없이 변경됩니다. "Cloudflare가 9월에 에이전트를 차단한다"는 말을 파이프라인의 확정 사실로 받아들이면 위험에 처하지도 않은 시스템을 불필요하게 재구축하게 됩니다.
광고 페이지 기준이 확산될 것이라 가정하십시오. Cloudflare는 광고를 표시하는 페이지를 기본값으로 지정했습니다. 이는 "이 페이지는 사람의 관심을 통해 수익을 창출한다"는 점을 나타내는 적절한 지표입니다. 이 기준선은 이동할 것이며, 이를 적용하는 곳은 Cloudflare뿐만이 아닙니다. AWS WAF는 2026년 6월 15일에 AI traffic monetization 기능을 출시하여 402 상태 코드와 기계 판독 가능한 결제 조건을 반환하도록 했습니다. Akamai는 TollBit 및 Skyfire와의 파트너십 방식을 택했습니다. 가장 큰 엣지 제공업체 세 곳이 이제 동일한 제어 수단을 판매하고 있으며, 당사는 pay-per-crawl이 출시되었을 때 이를 가격 책정 측면에서 살펴본 바 있습니다.
수집 시스템이 두 방식 모두에서 작동할 수 있도록 유지하십시오. 식별 경로(서명하고, 선언하고, 허용되거나 요금이 청구됨)와 비식별 경로(항상 그래왔듯 동작을 기반으로 평가받음)는 앞으로 수년간 공존할 것입니다. 어느 한쪽만 존재하는 것처럼 시스템을 구축하는 것은 양쪽 모두에서 비용이 많이 드는 실수가 됩니다.
분류 기준은 다시 작성될 것입니다
책임질 수 있는 예측 하나를 제시합니다. 1년 이내에 네 번째 카테고리가 등장할 것입니다.
모든 분류 체계의 첫 번째 버전은 압박을 받는 이들에 의해 작성되며, 분류 대상이 되는 사람들은 그 자리에 없습니다. Search, Agent, Training은 AI 기업이 퍼블리셔에게 수행하는 작업을 설명합니다. 이는 시장 조사 기관, 컴플라이언스 팀, 또는 경쟁사의 매장 가격을 확인하는 리테일 업체를 설명하지 못하며, 이 세 주체는 이 맥락에서 "agent"라는 용어가 의미를 갖기 훨씬 전부터 공개 페이지를 정중하게 수집해 왔습니다.
그 네 번째 항목을 무엇이라 부르고 누가 이를 선택할 수 있는지를 둘러싼 싸움은 올해 발표된 어떤 봇 탐지 벤치마크보다 데이터 업계에 더 중요할 것입니다. 이는 참여할 가치가 있는 싸움입니다.
대체 방안은 충분히 명확하기 때문입니다. 사용자의 트래픽이 스스로를 정의하지 못한다면, 다른 누군가가 대신 정의하게 될 것입니다.