Connection-Level 신호는 봇 탐지의 기본 요건입니다
98.6%.
이는 CatBoost 모델이 connection-level 기능만 사용하여 달성한 분류 정확도입니다. header, IP, 동작 모두 사용하지 않았습니다. 오직 초기 handshake의 형태만 사용했습니다. 이 arXiv 논문은 2026년 2월에 발표되었으며, 이 결과는 특이한 사례가 아닙니다. Cloudflare, AWS, VirusTotal, Akamai 모두 프로덕션 환경에서 connection-level fingerprinting을 실행합니다. 2026년에 일반 HTTP 클라이언트로 스크래핑을 한다면, request가 애플리케이션 계층에 도달하기도 전에 이미 판결이 내려집니다.
이 부분은 대부분의 봇 탐지 튜토리얼에서 생략됩니다. anti-bot 우회에 관한 대부분의 글은 여전히 User-Agent 교체, cookie, CAPTCHA에 초점을 맞춥니다. 이들은 쉬운 계층입니다. 하지만 connection 계층은 header로 속일 수 없는 계층입니다.
Fingerprint가 실제로 확인하는 것
Connection-level fingerprint는 초기 handshake 메시지의 해시입니다. 프로토콜(TCP 또는 QUIC), 버전, SNI 존재 여부, 정렬된 cipher suite, extension, 서명 알고리즘, ALPN을 인코딩합니다. 동일한 브라우저라고 주장하는 두 클라이언트는 동일한 해시를 생성합니다. Chrome이라고 주장하는 Python requests 스크립트는 스크래퍼를 제외하고는 세상 어디에도 존재하지 않는 fingerprint를 생성합니다.
현세대의 이러한 fingerprint는 이전 세대의 가장 큰 약점인 extension 순열을 해결했습니다. 이는 주요 브라우저들이 단순한 fingerprinting을 무력화하기 위해 2023년에 도입한 방식입니다. 새로운 설계는 extension을 정렬하고 계산하므로 무작위화는 도움이 되지 않습니다. 쉬운 탈출구는 없습니다.
Akamai는 cross-layer 분석을 통해 92-98%의 봇 분류 정확도를 공개했습니다. Cross-layer 부분이 중요합니다. Connection-level 신호 단독으로도 강력하지만, 이를 HTTP/2 프레임 순서, header 순서, request 타이밍과 결합하면 오탐률이 대부분의 스크래퍼가 견딜 수 있는 수준 이하로 떨어집니다.
Post-Quantum의 변수
아무도 예상하지 못한 부분입니다. 2026년 1월 31일, Akamai는 모든 연결에 대해 post-quantum 키 교환을 기본값으로 설정했습니다. 2026년 초까지 실제 브라우저가 시작한 연결의 57.4%가 X25519MLKEM768 키 공유를 포함합니다. Chrome의 PQ 지원 점유율은 약 93%입니다. Firefox는 85%입니다. Safari는 도입 중입니다.
PQ 키 공유는 큽니다. 기존 X25519의 36바이트와 비교하여 1,124바이트입니다. 초기 handshake 메시지는 300-500바이트에서 1,400바이트 이상으로 커졌습니다. 이러한 증가는 connection-level fingerprint, 패킷 캡처, WAF의 수동적 관찰에서 나타납니다.
스크래핑 클라이언트에 PQ 키 공유가 포함되지 않은 경우, 현재의 Chrome이나 Firefox라면 하지 않을 주장을 하는 셈입니다. 2026년 1분기의 두 CVE는 정확히 이 불일치를 지적합니다. CVE-2026-26995(패딩 extension)는 request당 25-50%의 탐지 확률을 가지며, CVE-2026-27017(ECH 및 GREASE 불일치)은 약 50%에 달합니다. 세션 전체에 걸쳐 결합되면 노출은 거의 확실해집니다.
이는 12개월짜리 문제가 3개월짜리 문제로 바뀌는 상황입니다. 대부분의 오픈소스 스크래핑 스택은 아직 PQ 호환 handshake를 제공하지 않습니다. 제공하는 스택도 실제 브라우저 빌드보다 몇 주 뒤처져 있습니다.
Proxy가 이를 해결하지 못하는 이유
더 큰 proxy 풀이 최신 봇 탐지를 해결한다는 위안이 되는 이야기가 돌고 있습니다. 그렇지 않습니다. Security Boulevard가 다룬 2026년 1월 스캘핑 사건에서는 390만 개의 고유 IP에 걸쳐 1,600만 개의 request를 사용했습니다. IP별 차단은 소용이 없었습니다. 효과적이었던 방어책은 대부분 connection-level 및 동작 fingerprinting이었습니다.
주거용 proxy의 경제성도 이번 분기에 무너졌습니다. Help Net Security는 2026년 4월에 1월 IPIDEA 네트워크 중단으로 업계 주거용 용량이 하룻밤 사이에 약 40% 감소했다고 보도했습니다. Bright Data와 Oxylabs의 특허 분쟁(대법원이 2026년 2월 23일에 Bright Data의 청원을 기각하고 5월 18일로 재판 일정을 잡음)은 이러한 용량 타격에 비하면 부차적인 문제입니다. fingerprinting에 대한 방어로 주거용 IP를 쫓는 구매자들은 WAF가 신경 쓰지 않는 해답을 위해 더 많은 비용을 지불하고 있습니다.
Proxy는 여전히 중요하지만, 대부분의 사람들이 생각하는 그런 이유는 아닙니다. 지리적 분포와 ISP 유형은 라우팅 결정 및 rate limit 프로필을 형성합니다. 이것들은 handshake에서 살아남는 데 도움이 되지 않습니다.
이것이 데이터 팀에 의미하는 바
2026년에 스크래핑 인프라를 구축하거나 구매하는 경우 세 가지가 달라집니다.
첫째, connection-level 스택은 이제 필수 요구 사항입니다. 최신 브라우저의 handshake(PQ 키 공유, extension 순서, ALPN, 서명 알고리즘)와 일치하지 않는 클라이언트는 높은 확신도로 봇으로 분류되는 fingerprint를 생성합니다. Python requests를 더 나은 header로 래핑해도 아무것도 해결되지 않습니다. 전송 계층이 증거가 됩니다.
둘째, headless 브라우저 탐지는 더 나빠졌지 개선되지 않았습니다. Browserless의 State of Web Scraping 2026 보고서에 따르면 headless 브라우저 인스턴스와 일반 브라우저 인스턴스 간의 격차가 벌어지고 있습니다. Anti-bot 공급업체는 fingerprint 차이를 목록화하고 고객 사이트 전체에서 거의 실시간으로 위협 정보를 공유합니다. 12월에 작동했던 headless 인스턴스가 5월에는 봇으로 분류될 수 있습니다. 동작 신호는 전송 계층 위에 쌓이며 두 가지 모두 계속 변화합니다.
셋째, 직접 구축과 구매 간의 계산이 바뀌었습니다. 변화하는 목표(브라우저는 몇 주마다 PQ 업데이트를 배포하고, 부 버전 간에 extension 순서가 바뀌며, cipher suite 기본 설정이 변함)에 일치하는 connection 서명을 유지하는 것은 이제 전담 업무가 되었습니다. 2024년에 스크래퍼 유지보수에 엔지니어 리소스의 20%를 썼던 팀은 2026년에 인력의 절반 이상을 소비하고 있습니다. 우리는 스크래퍼가 계속 고장나는 이유에 대해 이전에 작성한 바 있습니다. 2026년에는 그 이유가 "DOM"보다 "전송"인 경우가 더 많습니다.
가장 저렴한 스크래퍼는 분류되지 않는 스크래퍼입니다
흥미로운 예측은 anti-bot 공급업체가 계속해서 기준을 높일 것인지 여부가 아닙니다. 그들은 그럴 것입니다. 흥미로운 예측은 98%의 정확도가 기본 탐지 하한선인 시장에서 어떤 스크래핑 도구가 살아남을 것인가입니다.
대부분은 살아남지 못할 것입니다. 하지만 살아남는 도구는 handshake를 전송 세부 사항이 아니라 request의 일부로 취급할 것입니다. 그리고 구매자들은 12개월 전에는 평가 체크리스트에 없었던 질문을 공급업체에 하기 시작할 것입니다. 어떤 connection 서명을 제공하며 얼마나 빨리 업데이트합니까?
Request가 시도되기도 전에 handshake가 모든 것을 결정짓습니다.