연결 수준 신호는 봇 탐지의 기본 기준점입니다
98.6%.
이는 연결 수준 특성만 사용하여 CatBoost 모델이 달성한 분류 정확도입니다. header도, IP도, 행동 분석도 사용하지 않았습니다. 오직 초기 handshake의 형태만을 활용했습니다. 해당 arXiv 논문은 2026년 2월에 발표되었으며, 이 결과는 특이치가 아닙니다. Cloudflare, AWS, VirusTotal, Akamai 모두 프로덕션 환경에서 연결 수준 fingerprinting을 실행하고 있습니다. 2026년에 일반 HTTP 클라이언트로 스크래핑하고 있다면, request가 애플리케이션 레이어에 도달하기도 전에 이미 판정이 내려진 상태입니다.
이것이 대부분의 봇 탐지 튜토리얼에서 건너뛰는 부분입니다. 봇 탐지에 관한 대부분의 글은 여전히 User-Agent 순환, cookie, 인증 페이지에 집중되어 있습니다. 이들은 쉬운 레이어에 불과합니다. 하지만 연결 레이어는 header 조작만으로는 속일 수 없는 영역입니다.
fingerprint가 실제로 감지하는 요소
연결 수준 fingerprint는 초기 handshake 메시지의 해시값입니다. 프로토콜(TCP 또는 QUIC), 버전, SNI 포함 여부, 정렬된 cipher suites, extensions, 서명 알고리즘, ALPN을 인코딩합니다. 동일한 브라우저라고 주장하는 두 클라이언트는 동일한 해시를 생성합니다. Chrome이라고 주장하는 Python requests 스크립트는 스크래퍼 외에는 전 세계 어디에도 존재하지 않는 fingerprint를 생성합니다.
현재 세대의 fingerprint는 이전 세대의 가장 큰 약점이었던 extension permutation을 해결했습니다. 주요 브라우저들이 단순한 fingerprinting을 무력화하기 위해 2023년에 도입했던 방식입니다. 새로운 설계는 extension을 정렬하고 개수를 집계하므로 무작위화가 통하지 않습니다. 손쉬운 우회로는 없습니다.
Akamai는 교차 레이어 분석을 통해 92-98%의 봇 분류 정확도를 공개했습니다. 교차 레이어라는 점이 핵심입니다. 연결 수준 신호 자체만으로도 결정적이지만, 이를 HTTP/2 frame 정렬, header 순서, request 타이밍과 결합하면 오탐율(false-positive rate)이 대부분의 스크래퍼가 감당할 수 있는 수준 이하로 대폭 낮아집니다.
포스트 양자 암호(Post-Quantum)의 변수
이 부분은 아무도 예상하지 못했던 변화입니다. 2026년 1월 31일, Akamai는 모든 연결에 포스트 양자 키 교환을 기본값으로 적용했습니다. 2026년 초 기준으로 실제 브라우저가 시작한 연결의 57.4%에 X25519MLKEM768 키 공유가 포함되어 있습니다. Chrome의 PQ 지원 점유율은 약 93%에 달하며, Firefox는 85%이고, Safari도 배포 중입니다.
PQ 키 공유는 크기가 큽니다. 기존 X25519의 36바이트 대비 1,124바이트입니다. 초기 handshake 메시지는 300-500바이트에서 1,400바이트 이상으로 증가했습니다. 이러한 증가는 연결 수준 fingerprint, 패킷 캡처, WAF의 수동 관측(passive observation)에 그대로 드러납니다.
스크래핑 클라이언트에 PQ 키 공유가 포함되어 있지 않다면, 현재 Chrome이나 Firefox에서는 결코 나타날 수 없는 동작을 보이는 셈입니다. 2026년 1분기의 두 CVE는 정확히 이러한 불일치를 지적합니다. CVE-2026-26995(padding extension)는 request당 25-50%의 탐지 확률을 보이며, CVE-2026-27017(ECH 및 GREASE 불일치)은 약 50%의 확률을 나타냅니다. 세션 전체에 걸쳐 누적되면 노출 확률은 거의 확실한 수준으로 상승합니다.
12개월짜리 문제가 이제 3개월짜리 문제로 좁혀지고 있습니다. 대부분의 오픈소스 스크래핑 스택은 아직 PQ 호환 핸드셰이크를 지원하지 않습니다. 지원하는 극소수 도구조차 실제 브라우저 빌드보다 몇 주씩 뒤처져 있습니다.
프록시로 이 문제를 해결할 수 없는 이유
더 큰 프록시 풀을 쓰면 최신 봇 탐지를 우회할 수 있다는 그럴듯한 이야기가 돌고 있습니다. 사실이 아닙니다. Security Boulevard에서 다룬 2026년 1월 암표 사재기 사건에서는 390만 개의 고유 IP를 통해 1600만 건의 request가 발생했습니다. IP 단위 차단은 무력했습니다. 효과를 본 방어책은 대부분 연결 레벨 및 행동 기반 핑거프린팅이었습니다.
주거용 프록시의 경제성 역시 이번 분기에 무너졌습니다. Help Net Security의 2026년 4월 보도에 따르면, 1월 발생한 IPIDEA 네트워크 중단으로 인해 업계 전체 주거용 프록시 용량이 하룻밤 사이에 약 40% 감소했습니다. Bright Data와 Oxylabs 간의 특허 분쟁(대법원은 2026년 2월 23일 Bright Data의 상고를 기각했으며 5월 18일 재판 예정)은 이러한 용량 타격에 비하면 부차적인 문제입니다. 핑거프린팅 방어책으로 주거용 IP를 찾는 구매자들은 WAF가 신경 쓰지도 않는 해결책에 더 많은 비용을 치르고 있습니다.
프록시는 여전히 중요하지만, 대다수가 생각하는 이유 때문은 아닙니다. 지리적 분산과 ISP 유형은 라우팅 결정과 rate limit 프로필을 형성합니다. 그러나 핸드셰이크 단계에서 살아남는 데는 도움이 되지 않습니다.
데이터 엔지니어링 팀에 주는 시사점
2026년에 스크래핑 인프라를 구축하거나 도입하려 한다면 다음 세 가지가 달라집니다.
첫째, 연결 레벨 스택이 이제 필수 요건입니다. 최신 브라우저의 핸드셰이크(PQ 키 공유, 익스텐션 순서, ALPN, 서명 알고리즘)와 일치하지 않는 클라이언트는 높은 신뢰도로 봇으로 분류되는 핑거프린트를 남깁니다. Python requests를 더 정교한 header로 감싸는 방식은 아무것도 해결하지 못합니다. 전송 계층 자체가 명백한 증거입니다.
둘째, headless 브라우저 탐지는 개선되기는커녕 더 까다로워졌습니다. Browserless의 State of Web Scraping 2026 보고서에 따르면 headless와 일반 브라우저 인스턴스 간의 격차는 계속 벌어지고 있습니다. 봇 탐지 벤더들은 핑거프린트 차이점을 체계화하고 고객사 사이트 전반에 걸쳐 위협 인텔리전스를 실시간에 가깝게 공유합니다. 12월에 작동하던 headless 인스턴스가 5월에는 봇으로 분류될 수 있습니다. 행동 신호가 전송 계층 위에 중첩되며, 두 계층 모두 지속적으로 변화하는 대상입니다.
셋째, 직접 구축과 솔루션 구매 간의 손익 계산이 달라졌습니다. 지속적으로 변화하는 브라우저 지표에 맞춰 연결 signature를 유지하는 작업(브라우저는 몇 주마다 PQ 업데이트를 배포하고, 마이너 버전 간 확장 순서가 바뀌며, cipher suite 우선순위가 변경됨)은 이제 전담 인력이 필요한 일이 되었습니다. 2024년에 스크래퍼 유지보수에 엔지니어 공수의 20%를 쓰던 팀들이 2026년에는 0.5인분 이상의 공수를 투입하고 있습니다. FourA는 스크래퍼가 계속 깨지는 이유에 대해 이전에 다룬 적이 있습니다. 2026년에는 그 원인이 "DOM"보다는 "transport" 계층인 경우가 더 많습니다.
가장 비용 효율적인 스크래퍼는 탐지 대상에 분류되지 않는 스크래퍼입니다
핵심 예측은 봇 탐지 벤더들이 기준을 계속 높일지 여부가 아닙니다. 그들은 계속 높일 것입니다. 핵심 예측은 98%의 탐지 정확도가 기본 요건이 된 시장에서 어떤 스크래핑 툴이 살아남을 것인가입니다.
대부분은 살아남지 못할 것입니다. 하지만 살아남는 툴들은 handshake를 단순한 transport 세부사항이 아닌 request의 일부로 다룰 것입니다. 그리고 구매자들은 12개월 전 평가 체크리스트에는 없었던 질문을 벤더에게 던지기 시작할 것입니다. 바로 어떤 연결 signature를 제공하며, 얼마나 빠르게 업데이트하는가 하는 점입니다.
request가 본문을 전송하기도 전에 handshake 단계에서 이미 결과가 결정됩니다.