← 전체 글

Pay-Per-Crawl이 웹을 둘로 나누고 있다

Cloudflare의 pay-per-crawl 마켓플레이스와 HTTP 402는 웹을 라이선스 데이터와 공개 데이터로 양분합니다. 2026년 웹 데이터를 수집하는 팀들에게 어떤 변화가 생길지 알아봅니다.

2026년 2월 19일, Stack Overflow와 Cloudflare는 웹 데이터 업계 대부분이 예상하지 못한 방식을 공개했습니다. 양사는 크롤당 과금(pay-per-crawl) 체계를 공동 출시했습니다. 이 시스템에서 AI 크롤러는 실시간 402 Payment Required 응답을 수신하며, 퍼블리셔가 책정한 비용을 지불하거나 요청을 중단할 수 있습니다. 봇 신원은 엣지에서 검증되고, 가격은 사이트가 설정하며, 트랜잭션은 사용량에 따라 측정됩니다.

Cloudflare는 인터넷 사이트의 약 5분의 1 앞단에 위치합니다. 따라서 이들이 알려진 AI 봇에 대해 기본 차단으로 전환하고 퍼블리셔가 요청당 과금할 수 있는 마켓플레이스를 구축함에 따라, 공개 웹의 상당 부분에 대한 접근 모델이 주말 사이에 바뀌었습니다.

현재 웹 데이터 인프라를 구축하고 있다면 이는 단순히 지나칠 Cloudflare 발표가 아닙니다. 이는 "공개"의 의미에 대한 계산 방식을 바꿉니다.

전환 뒤에 숨은 메커니즘

기술적 조치는 단순합니다. Cloudflare는 오랜 기간 사용되지 않던 "Payment Required" 상태 코드인 HTTP 402를 부활시키고, 이를 검증된 AI 크롤러 레지스트리에 연결했습니다. 퍼블리셔는 요청당 가격을 설정합니다. 크롤러는 크레딧 잔액을 보유하여 비용을 지불하거나 차단됩니다.

비기술적인 파급력은 더 큽니다. 이전까지 "AI 학습을 위해 내 콘텐츠를 스크래핑하지 마라"를 강제하는 유일한 방법은 robots.txt(권고일 뿐 강제력 없음)와 공격적인 봇 차단(이분법적이며 손실이 크고 오탐이 많음)뿐이었습니다. Cloudflare는 세 번째 옵션을 추가했습니다. 바로 가격표입니다.

이 세 번째 옵션의 경제성은 앞의 두 가지와 다르게 작동합니다. Robots.txt는 비용이 들지 않지만 무시됩니다. 봇 차단은 봇으로 잘못 분류된 실제 사용자의 트래픽 손실을 초래합니다. 반면 가격표는 지불 의사가 있는 크롤러와 그렇지 않은 크롤러를 구조적으로 분리합니다.

실제로 누가 과금하고 있는가

Stack Overflow가 론칭 파트너였던 이유는 이들의 학습 데이터 가치가 실제로 높고 이미 OpenAI 등과 양자 계약을 협상 중이었기 때문입니다. Cloudflare의 마켓플레이스는 이러한 양자 계약을 다른 퍼블리셔들도 연동할 수 있는 레지스트리로 일반화했습니다.

참여 목록은 빠르게 늘어났습니다. AWS는 자체 봇 수익화 계층을 출시했습니다. Akamai도 유사한 시스템을 구축했습니다. 퍼블리셔를 향한 제안은 명확합니다. AI 연구소를 상대로 비용이 많이 드는 소송을 진행하는 대신 요청당 수익을 창출하는 라인을 확보하라는 것입니다.

현재 이는 주로 고가치 콘텐츠 계층에 적용됩니다. 문서, 뉴스, 기술 Q&A, 구조화된 레퍼런스 데이터가 여기에 해당합니다. 웹의 롱테일 영역(소규모 전자상거래 사이트, 지역 디렉터리, 틈새 포럼)은 이러한 게이트 뒤에 있지 않으며 앞으로도 그럴 가능성이 높습니다. Cloudflare 자체 봇 관리도 운영 비용이 발생하며, 크롤당 과금은 옵트인 방식입니다. 단일 페이지 조회가 과금할 가치가 있는 사이트에만 실익이 있습니다.

웹 데이터 파이프라인에 미치는 영향

Stack Overflow, 주요 뉴스 사이트, 또는 활발히 참여 중인 퍼블리셔로부터 데이터를 가져오는 파이프라인을 구축 중이라면 선택지는 세 가지로 좁혀집니다. 트래픽이 AI 크롤러로 식별되는 즉시 마켓플레이스를 통해 비용을 지불하는 것. 라이선스가 부여된 데이터셋이 있다면 그것으로 전환하는 것. 혹은 데이터가 여전히 공개되어 있는 다른 소스를 찾는 것입니다.

대부분의 팀은 결국 시점에 따라 세 가지 방법을 모두 사용하게 될 것입니다. 이것이 현실적인 상황입니다. 웹은 라이선스 영역과 오픈 영역으로 나뉘고 있으며, 그 경계는 도메인 단위로 깔끔하게 구분되지 않습니다. 동일한 퍼블리셔라도 특정 섹션은 402 뒤에 두고 다른 섹션은 공개해 둘 수 있습니다. 같은 사이트가 특정 크롤러에는 과금하고 연구용 봇은 완전히 무시할 수도 있습니다.

엔지니어링 팀의 실질적인 대응 방안은 다음과 같다고 봅니다. 첫째, 데이터 소스를 점검하십시오. 파이프라인의 상당 부분이 Stack Overflow, Reddit, 주요 뉴스 사이트, 또는 이러한 계약을 적극적으로 추진 중인 수십 개의 퍼블리셔에서 데이터를 가져오고 있다면, 12개월 이내에 접근 모델이 변경될 것으로 가정해야 합니다. 둘째, 아키텍처 내부에서 라이선스 소스와 오픈 소스를 조기에 분리하십시오. 소스의 절반은 과금을 요구하고 나머지 절반은 그렇지 않은 상황에서, 모든 소스를 동일하게 처리하는 파이프라인은 취약할 수밖에 없습니다. 셋째, robots.txt를 유일한 신호로 취급하지 마십시오. 402 응답은 크롤러가 AI 에이전트가 아니더라도 운영상 유의미한 영향을 미칠 것입니다. 이처럼 새로운 시스템에서는 오탐이 발생할 수밖에 없습니다.

이는 이미 팀들이 출처 추적이 가능한 소스로 전환하도록 압박하고 있는 EU AI Act의 학습 데이터 규제 압력과 맞물려 있습니다. 크롤링당 과금 모델은 여기에 결제 레이어가 추가된 동일한 압박입니다.

솔직한 분석

몇 가지 혼란을 야기할 수 있는 지점이 있습니다. Cloudflare의 신원 검증은 봇의 등록 여부에 의존합니다. 등록하지 않은 봇이나 주거용 트래픽처럼 보이는 봇은 402를 전혀 트리거하지 않습니다. 대신 일반적인 봇 탐지 시스템에 걸리게 됩니다. 이는 이미 대부분의 공격적인 AI 크롤러가 택하고 있는 경로입니다. 따라서 크롤링당 과금 모델은 규정을 준수하려는 봇에만 유효합니다. 규정을 준수하지 않는 봇들은 애초에 robots.txt도 준수하지 않았을 것입니다.

더 큰 변화는 마켓플레이스 자체에 국한되지 않을 수 있습니다. "이 콘텐츠가 AI 학습에 사용 가능한가"라는 질문이 robots.txt를 통한 추측이 아닌 계약을 통한 답변으로 바뀌었다는 점입니다. 퍼블리셔는 마침내 통제권을 확보하고, 크롤러는 명확히 파악할 수 있게 되었습니다. 마켓플레이스가 도달하는 영역에서는 회색지대가 줄어듭니다.

여전히 회색지대로 남는 것은 마켓플레이스 외부의 모든 영역입니다. Cloudflare를 사용하지 않는 소규모 사이트, AI 전략이 없는 지역 애그리게이터, 아무도 협상하지 않는 롱테일 웹 등은 402를 적용받지도 못하고 라이선스 계약을 맺지도 못합니다. 이들은 보상에 대한 선례가 생겼다는 점에 대해 더 강하게 반발할 뿐, 기존의 접근 정책을 그대로 유지하게 됩니다.

향후 전망

두 가지 예측이 있으며, 결코 낙관적인 전망은 아닙니다.

첫째, 향후 12개월 동안 비 AI 봇을 대상으로 한 두 번째 계층의 페이월이 등장할 것입니다. 마켓플레이스 메커니즘은 HTTP 상태 코드와 과금 레이어에 불과합니다. 이를 검색 크롤러 요금제, 아카이브 봇 요금제, 경쟁사 모니터링 요금제로 확장하는 것은 기술적으로 어렵지 않습니다. 퍼블리셔가 AI 크롤러에만 비용을 청구하는 원칙을 유지할지는 다음 트래픽의 양상에 달려 있습니다. 대개의 경우 이러한 경계는 무너집니다.

둘째, AI 연구소들은 이를 우회할 것입니다. 402 상태 코드를 무시하는 방식(추적 가능하며 소송 위험이 있음)이 아니라, 라이선스 데이터셋을 대량으로 구매한 뒤 나머지 모든 트래픽을 실제 사용자처럼 보이도록 유입시키는 방식을 씁니다. Cloudflare가 행동 기반 탐지 기능을 강화하여 배포하는 이유도 바로 이를 알고 있기 때문입니다. 우리는 군비 경쟁이 세션 레벨 신호로 이동하는 과정을 지난 2년간 지켜보았습니다. 이는 마켓플레이스만으로 끝나지 않습니다.

엔지니어에게 중요한 질문은 비용 지불 여부가 아닙니다. 오픈 웹이 어디까지 열려 있을지, 그리고 그것이 얼마나 지속될지입니다.