← 전체 글

Google SerpApi 소송: 봇 탐지 우회 자체가 쟁점이 아닌 이유

동일한 Google 봇 탐지에 대해 11일 간격으로 엇갈린 판결이 나왔습니다. Google SerpApi 소송은 이제 봇 차단 뒤에 위치한 콘텐츠의 소유권이 핵심 쟁점임을 보여줍니다.

하나의 봇 검증, 두 법원, 상반된 판결

올여름 11일 간격으로 두 연방 판사가 동일한 Google 봇 검증, 동일한 피고, 동일한 유형의 청구를 심리했습니다. 판결 결과는 정반대였습니다.

2026년 7월 20일, 캘리포니아 북부 연방지방법원의 이본 곤잘레스 로저스(Yvonne Gonzalez Rogers) 수석판사는 API를 통해 Google 검색 결과를 판매하는 기업인 SerpApi에 대한 Google의 DMCA 청구를 기각했습니다. 7월 31일, 뉴욕 남부 연방지방법원의 폴 엥겔마이어(Paul Engelmayer) 판사는 동일한 Google 시스템을 기반으로 제기된 Reddit의 소송에 대해 SerpApi와 Perplexity가 제출한 기각 신청을 대부분 기각했습니다.

사건 법원 판결일 DMCA 청구
Google v. SerpApi 캘리포니아 북부 연방지법 2026년 7월 20일 기각
Reddit v. SerpApi 뉴욕 남부 연방지법 2026년 7월 31일 대부분 유지

Google과 SerpApi 간의 소송이 주요 언론의 헤드라인을 장식했고, 많은 매체는 7월의 결과를 스크래퍼 진영의 1승 1패로 평가했습니다. FourA의 해석은 다릅니다. 두 판결의 결과를 가른 것은 검증 우회 여부가 아니었습니다. 검증 뒤에 무엇이 존재하는지, 그리고 그에 대한 권리를 누가 보유하고 있는지가 결과를 결정했습니다. 웹 데이터를 수집하는 엔지니어에게는 헤드라인보다 이 기준이 훨씬 유용합니다.

클라이언트 입장에서 본 SearchGuard의 작동 방식

SearchGuard는 Google이 2025년 1월 Search 전면에 도입한 JavaScript 챌린지입니다. Google의 설명에 따르면, 식별되지 않은 소스에서 쿼리가 인입되면 실행용 코드가 반환됩니다. 사용자의 브라우저는 이를 인지하지 못한 채 백그라운드에서 처리하지만, 대부분의 자동화 클라이언트는 이를 수행하지 못해 요청이 차단됩니다.

FourA의 자체 테스트에서도 동일한 현상이 확인되었습니다. 2026년 9월 17일에 진행한 테스트에서 Google Search는 일부 자동화 요청에 대해 "Google Search"라는 제목의 92 KB 크기 페이지로 응답했습니다. 응답은 HTTP 200이었으나 결과는 비어 있었고 JavaScript를 활성화하라는 안내만 포함되어 있었습니다. Reddit의 자체 차단 화면 역시 네트워크 통신상으로는 유사하게 표시됩니다 ("Reddit - Prove your humanity" 제목의 200 응답). 상태 코드만으로 성공 여부를 판단하는 시스템은 두 응답을 모두 정상 전송된 페이지로 기록합니다.

주요 보도에서 간과된 핵심은 다음과 같습니다. 곤잘레스 로저스 판사는 SerpApi가 SearchGuard를 우회하지 않았다고 판단한 것이 아닙니다. 판사는 Google이 DMCA Section 1201 청구를 적절히 주장했다고 보았으며, 소유권자가 아니므로 Google이 소송을 제기할 수 없다는 SerpApi의 주장도 기각했습니다. 그럼에도 Google은 패소했습니다.

핵심 시사점: 법원은 "검증을 우회했는가?"를 결정적인 판단 기준으로 보지 않습니다. 이를 판단의 출발점으로 삼을 뿐입니다.

Google은 패소하고 Reddit은 승소한 이유

DMCA 제1201조는 '본 조항에 따라 보호받는 저작물', 즉 저작권이 있는 저작물에 대한 접근을 제어하는 조치를 우회하는 행위를 금지합니다. Google 자체 소장에서는 검색 결과를 공개 정보의 편집물로 기술하며 지식 패널에 '일부 저작권 보호 콘텐츠가 포함될 수 있다'고 밝혔습니다. 법원의 명령은 Google의 진술을 그대로 받아들였습니다: "Google Search 결과에 저작권 보호 콘텐츠가 포함되어 있지 않은 한, SearchGuard가 저작권법에 따라 보호받는 저작물에 대한 접근을 효과적으로 제어한다고 볼 수 없다." 이 소송의 해당 부분은 수정 허가 없이 기각되었습니다.

지식 패널 관련 부분은 두 번째 검증을 통과하지 못했습니다. 해당 보호 조치는 '저작권자의 권한'으로 작동해야 하지만, Google은 해당 이미지 이면에 있는 라이선스 조건을 단 하나도 소명하지 않았습니다. Google은 게이트를 운영할 뿐이며, 그 게이트 뒤에 있는 대부분의 저작물을 소유하지 않습니다.

Reddit의 입장은 다릅니다. 사용자의 게시물은 저작권 보호를 받으며, Reddit의 사용자 계약은 해당 게시물 전부에 대한 라이선스를 Reddit에 부여합니다. Engelmayer 판사는 1201(b) 청구 및 주법상 부당이득, 부정경쟁 혐의는 기각하면서도, 두 피고에 대한 제1201조(a)(1)(A) 청구와 SerpApi에 대한 제1201조(a)(2) 청구를 유지했습니다. 기준은 동일했지만, 이 원고는 자신이 보호하는 콘텐츠에 대한 권리를 가지고 있었습니다. 법원은 Google 페이지에 표시되는 짧은 스니펫이 보호 대상인지에 대한 판단은 열어두었으며, 해당 소송의 피고로 함께 지목된 Oxylabs의 기각 신청은 여전히 계류 중입니다.

라이선스가 새로운 잠금장치가 되는 과정

Google은 의도를 파악했습니다. 8월 10일에 제출된 Google의 수정 소장은 계약을 중심으로 소송 논리를 재구성합니다. 라이선스 제공자가 접근 통제를 승인했으며 '일부 경우에는 Google이 이를 시행하도록 요구했다'고 명시합니다. 또한 익명의 한 파트너가 2017년부터 Google에 '무단 제3자 접근으로부터 라이선스 콘텐츠를 보호하기 위해 상업적으로 합당한 노력을 기울일 것'을 의무화했으며, Reddit과의 계약은 'Google이 제3자로 하여금 라이선스 콘텐츠를 추출하고 독립적으로 상업화하도록 허용하지 말 것'을 지시하고 있다고 기술합니다. 심지어 Google 자체의 개인정보 처리방침을 사용자의 권한 부여 근거로 제시하기도 합니다.

SerpApi의 두 번째 기각 신청에서는 이러한 계약 중 어느 것도 법원에 실제로 제출되지 않았으며, '다운로드 금지 조항이 접근 차단 조항은 아니다'라고 반박합니다. 9월 15일, 판사는 Google에 라이선스 제출을 강제해 달라는 SerpApi의 요청을 기각했습니다. 사건 기록부에 따르면 기각 신청 자체에 대한 심리는 2026년 10월 13일로 예정되어 있습니다.

우리는 10월 판결 자체보다 그것이 이미 만들어낸 플레이북이 더 중요하다고 봅니다. 라이선스 사용자에게 무단 액세스로부터 콘텐츠를 보호하도록 요구하는 조항은 이전에는 형식적인 문구에 불과했습니다. 하지만 이번 여름 이후, 이 조항은 위반 건당 200달러에서 2,500달러에 달하는 법정 손해배상 청구의 핵심 요건이 되었습니다. 따라서 앞으로 체결되는 모든 콘텐츠 계약에는 pay-per-crawl을 중심으로 형성되기 시작한 유료 액세스 계약을 포함하여 해당 조항이 포함될 것으로 예상해야 합니다.

Accounts Were Never the Open Question

이 사안의 한 측면은 전혀 변하지 않았습니다. 9월 중순 캘리포니아 연방 법원은 Netswift와 파트너 관계인 ProAPIs 간의 LinkedIn과의 동의 판결(consent judgment)을 최종 확정했습니다. 스크래핑 중단, 데이터 판매 또는 이전 중단, 가짜 계정 사용 중단, 수집된 데이터 삭제가 골자입니다. LinkedIn의 소장에는 수백만 개의 허위 계정이 언급되었으며, 매일 수백 또는 수천 개가 새로 생성되었습니다.

이러한 혐의는 단순한 보안 체크 우회가 아닌 계정 생성에 집중되었습니다. 그리고 그 결과는 액세스 차단, 재판매 금지, 데이터 파기라는 전면적 조치였습니다.

What This Means for Data Teams

우리는 엔지니어이지 변호사가 아니며, 7월의 두 판결 모두 본안 재판이 아닌 기각 신청(motion-to-dismiss) 단계에서 나왔습니다. 다음 내용을 법적 논쟁이 흘러가는 방향에 대한 지침으로 참고하시고, 실질적인 법적 문제는 법률 자문을 받으시기 바랍니다.

  1. 수집하는 데이터의 성격에 따라 대상을 분류하십시오. 가격, 재고 수준, 순위, 링크 및 목록은 사실 정보(facts)입니다. 게시물, 리뷰, 기사, 사진 및 가사는 표현물(expression)입니다. 7월 20일 자 명령의 영구적 부분은 전자를 다루며, Reddit 소송은 후자에 해당합니다.
  2. 수집 경로가 바뀐다고 콘텐츠의 권리 관계가 사라지지 않습니다. Reddit의 유효한 청구는 reddit.com이 아니라 Google 검색 결과 페이지에서 수집된 것으로 추정되는 게시물에 관한 것입니다. 검색 중개자를 통해 사용자 콘텐츠를 가져오더라도 원소유자의 청구권은 그대로 유지됩니다.
  3. 콘텐츠 소유자의 자체 보안 조치는 강력한 법적 근거가 됩니다. Google의 취약점은 타인의 저작물에 대해 자체 게이트를 운영했다는 점이었습니다. 기사를 직접 소유하고 이를 보호하기 위해 봇 차단 솔루션을 도입한 퍼블리셔는 이러한 취약점이 없으며, Zyte의 State of Web Access 2026에 따르면 상위 사이트의 18.5%가 자체 선택에 따라 전용 봇 탐지 서비스를 운영하고 있습니다.
  4. 로그인 단계를 점검하십시오. 파이프라인의 어느 한 단계에서라도 로그인이 이루어진다면, 법원이 봇 탐지 우회에 대해 어떤 판단을 내리든 법적 리스크는 그 지점에 집중됩니다.
  5. 법원이 해결해 주지 않는 기술적 마찰 비용을 예산에 반영하십시오. Google은 8월 26일 검색 결과 링크가 이제 google.com/goto 리디렉션을 거친다는 점을 확인했습니다. Nozzle의 Derek Perkins는 보고서를 통해 해당 링크를 로컬에서 디코딩할 수 없으며 5페이지 분량의 순위를 분석하는 데 500~1,000개의 request가 필요하다고 밝혔습니다. 여기에 2025년 9월의 num=100 제거 조치(순위 추적에 미친 영향)까지 더해지면서, 법적 판결 없이도 검색 데이터 수집 비용은 두 차례나 상승했습니다.

From Code to Contracts

수년 동안 스크래핑에 관한 논쟁은 봇 차단 조치를 일종의 잠금장치로 볼 수 있는지에 집중되었습니다. 이번 여름에 나온 답은 단순한 긍정이나 부정보다 더 명확합니다. 내부 데이터 소유자 또는 이들이 서면으로 권한을 부여한 주체가 해당 잠금장치를 관리한다면, 잠금장치로 인정될 수 있습니다.

이로 인해 분쟁의 영역은 엔지니어링에서 라이선스 부서로 이동했습니다. 여기에 선언된 목적에 따라 봇 트래픽을 분류하려는 Cloudflare의 움직임까지 더해지면서 흐름은 분명해졌습니다. 이제 접근 권한은 request의 형태보다는 접속 주체가 누구인지, 어떤 계약을 체결했는지에 따라 결정되고 있습니다.

공개된 사실 데이터를 수집한다면 7월 판결로 입지가 더 명확해졌습니다. 반면 타인의 관문을 거쳐 타인의 저작물을 수집하고 있다면, 이를 정당화하기는 훨씬 더 어려워졌습니다.