AI 학습 데이터의 무제한 수집 시대가 끝나고 있습니다
2025년 중반 기준, AI 관련 웹 트래픽의 75%가 학습 데이터 수집이었습니다 (Cloudflare Radar via Bright Data, 2025). 추론도, 검색도 아닙니다. 학습이었습니다. 다음 모델에 공급하기 위해 크롤러가 웹 페이지를 긁어모으는 트래픽이었습니다.
그 시대가 저물고 있습니다.
지난 6개월간 세 가지 변화가 맞물렸습니다. EU AI Act의 투명성 요건이 초안 단계에서 실제 집행 단계로 전환되었습니다. 사이트들이 대규모로 AI 크롤러를 차단하기 시작했습니다. 2023년 9월 23%였던 차단 비율은 2025년 말 기준 신뢰할 수 있는 도메인의 60%까지 증가했습니다 (Ars Technica, 2025). 그리고 학습 데이터 구매자들은 데이터의 출처에 대해 새로운 질문을 던지기 시작했습니다.
스크래핑한 데이터를 사용하여 모델을 학습시키는 프로덕트를 개발 중이라면, 대부분의 팀이 아직 계산에 넣지 않은 문제에 직면하게 됩니다.
EU AI Act가 실제로 요구하는 사항
2026년 시행안은 AI 학습 데이터 출처에 대한 투명성 요건을 도입합니다 (Scalevise summary, 2026). 범용 AI 모델 제공업체는 학습에 사용된 데이터 요약본을 공개해야 합니다. 원작자와 저작권자는 수집을 거부(opt-out)할 수 있으며, 이 거부 권리는 모델 학습 레이어가 아닌 데이터 수집 레이어에서 존중되어야 합니다 (학습 레이어에서는 이미 늦습니다).
실무적으로 조달 체크리스트에는 다음 세 가지 항목이 포함됩니다.
- 크롤링한 사이트 목록, 시점, 권한 조건에 대한 공개 기록
- robots.txt 및 명시적 거부 신호를 준수하는 메커니즘
- 2년 후의 감사에서도 유효한 데이터 계보(Data lineage)
하지만 주의할 점이 있습니다. 어디서 무엇을 가져왔는지 모르는 파이프라인에 사후 컴플라이언스를 덧붙일 수는 없습니다. 스크래핑을 사이드 프로젝트 수준으로 구축했던 팀들은 "사이드 프로젝트"와 "감사 대비 가능 상태"가 양립할 수 없다는 사실을 곧 깨닫게 될 것입니다.
즉, 이제 벤더 선정 시 "데이터 수집 파트너가 깨끗한 감사 추적 기록을 제공할 수 있는가?"라는 질문이 필수가 됩니다. 2024년에는 대부분의 체크리스트에 없던 질문이지만, 2026년 3분기까지는 모든 진지한 조달 과정의 표준이 될 것입니다.
더 까다로워진 데이터 브로커 검증
Bright Data는 3억 달러 이상의 연간 환산 매출과 전년 대비 50% 이상의 성장을 기록했으며, AI용 데이터가 이 성장을 견인하고 있음을 명확히 밝혔습니다. 규정을 준수하는 학습 데이터 시장이 급성장한 이유는 대안인 무단 스크래핑의 위험이 다음 두 가지 측면에서 크게 증가했기 때문입니다.
첫째, 법적 리스크의 범위가 넓어졌습니다. 미 대법원은 2026년 2월 Bright Data의 특허 청원을 기각했으며, 이들의 주거용 proxy 특허 2건이 무효화되었습니다. Oxylabs는 맞소송을 제기했고 재판은 2026년 5월 18일로 예정되었습니다. 사안의 시비와 무관하게, 데이터 수집 방식을 둘러싼 소송 비용은 막대합니다. 이를 지켜보는 중소 업체들도 결코 안심할 수 없습니다.
둘째, 기술적 난이도 역시 높아졌습니다. Bot 탐지 벤더들이 고객 사이트 간 위협 인텔리전스를 실시간으로 공유하기 시작했습니다. 한 이커머스 사이트에서 감지된 스크래핑 패턴은 몇 시간 내에 수백 개 사이트에서 차단될 수 있습니다(SecurityBoulevard, 2026). 저렴한 proxy를 순환시키며 성공하기를 바라는 기존 방식은 2025년 말 무렵부터 더 이상 통하지 않게 되었습니다. 이 변화는 행위 기반으로 전환된 bot 탐지 글에서 다룬 바 있습니다.
종합하면, 학습 데이터 직접 수집에 드는 비용은 법적, 기술적 두 측면 모두에서 증가했습니다. 법적 위험과 기술적 난이도가 모두 높아졌습니다. 여전히 자체 수집을 진행 중인 기업들은 인프라에 막대한 비용을 지출하거나, 데이터셋이 감사 통과 기준에 미치지 못할 위험을 감수하고 있습니다.
2027년 중반까지의 전망
향후 18개월 동안 벤더 시장은 세 가지 방향으로 재편될 것으로 보입니다.
컴플라이언스가 기본 요구사항이 됩니다. ISO 27001, SOC 2, GDPR 준수 프로세스, 데이터 계보(lineage) 등은 차별화 요소가 아니라 최소 기준이 됩니다. Bright Data는 이미 ISO 27001 및 SOC 2를 취득했습니다. 대부분의 경쟁사는 이를 맞추기 위해 서두르고 있습니다. 본격적인 AI 제품을 배포하는 팀은 인증서를 제시하지 못하는 데이터 수집 벤더의 도입을 거부할 것입니다.
감사 추적(Audit trail)이 핵심 기능이 됩니다. 현재 대부분의 스크래핑 API는 데이터만 반환하고 나머지는 모두 버립니다. 2027년까지 상당수의 고객은 소스 URL, 수집 시각, response code, 수집 당시 robots.txt 상태, opt-out 확인 여부 등의 기록을 요구하게 될 것입니다. 이러한 메타데이터는 모델의 적법성에 이의가 제기될 때 컴플라이언스를 입증하는 결정적 수단이 됩니다.
벤더 통합이 가속화됩니다. 컴플라이언스 유지 비용은 규모의 경제를 가진 쪽에 유리합니다. 월 $69 플랜에 의존하는 소규모 스크래핑 API는 엔터프라이즈 시장으로 전환하거나 AI 학습 관련 계약에서 배제될 것입니다. 컴플라이언스와 합리적인 가격대를 동시에 갖춘 미드마켓 벤더들이 이 수요를 흡수하게 됩니다. 지난달에 분석한 자체 구축 대비 구매(build-vs-buy) 손익 계산은 자체 구축 쪽에 한층 더 불리해졌습니다.
엔지니어링 팀에 미치는 영향
향후 12개월 내에 AI 제품을 출시할 계획이라면, 데이터 소싱 결정은 더 이상 단순한 인프라 문제가 아닙니다. 이는 법적 리스크이자 시장 진입 가능 여부를 가르는 문제입니다.
현재 파이프라인에 대해 점검해야 할 세 가지 사항은 다음과 같습니다.
지난 12개월 동안 크롤링한 모든 도메인을 타임스탬프와 함께 나열할 수 있습니까? 불가능하다면 기본적인 감사도 통과할 수 없습니다.
학습 시점이 아닌 수집(fetch) 시점에 옵트아웃 신호를 준수하고 있습니까? Robots.txt와 X-Robots-Tag는 더 이상 선택 사항이 아닙니다.
데이터 공급업체가 내일 당장 이용 약관을 변경한다면 귀사의 학습 파이프라인은 유지될 수 있습니까? 대부분의 팀은 이에 대해 확인조차 하지 않았습니다.
지금 확인하십시오. 아직 1년 정도의 여유가 있다고 생각했던 기업들에 이미 첫 번째 감사 요청이 전달되기 시작했습니다.
FourA의 관점
설계 단계부터 준수하는 컴플라이언스(Compliance-by-design)는 마케팅 문구가 아닙니다. 웹 데이터에 의존하는 제품을 만드는 팀에게 이는 생존이 걸린 문제입니다. 지금 데이터 계보(data lineage)를 P0 기능으로 다루는 팀은 2027년에 겪게 될 치명적인 혼란을 피할 수 있습니다. 이를 단순한 서류 작업으로 치부하는 팀은 결국 그 서류 작업 때문에 제품을 시장에 출시하지 못하게 된다는 사실을 깨닫게 될 것입니다.
학습 데이터의 무법지대가 끝나는 이유는 규제 당국이 악의적이어서가 아닙니다. 문제를 잘못 처리했을 때의 결과가 "당혹스러운 블로그 글 작성" 수준에서 "유럽 내 제품 출시 불가"로 바뀌었기 때문입니다. 이는 공급망 전체의 셈법을 바꿉니다.