Эпоха бесконтрольного сбора данных для обучения AI заканчивается
В середине 2025 года 75% всего web-трафика, связанного с AI, приходилось на сбор обучающих данных (Cloudflare Radar через Bright Data, 2025). Не inference. Не поиск. Обучение. Краулеры собирали страницы для следующей модели.
Эта эпоха подходит к концу.
За последние шесть месяцев сошлись три фактора. Требования прозрачности в EU AI Act перешли из стадии проектов в статус обязательных к исполнению. Сайты начали массово блокировать AI-краулеры: 60% авторитетных доменов к концу 2025 года по сравнению с 23% в сентябре 2023 года (Ars Technica, 2025). А покупатели обучающих данных стали задавать новые вопросы об их происхождении.
Если вы создаете продукт, использующий собранные скрапингом данные для обучения моделей, у вас возникла проблема, которую большинство команд еще не заложили в расходы.
Что на самом деле требует EU AI Act
Вступление норм в силу в 2026 году вводит требования к прозрачности источников данных для обучения AI (обзор Scalevise, 2026). Поставщики универсальных AI-моделей обязаны публиковать сводки о том, на чем они обучались. Авторы и правообладатели могут запретить использование своего контента (opt-out), и этот запрет должен соблюдаться на этапе сбора данных, а не на этапе обучения модели (когда уже слишком поздно).
На практике в чек-листах при закупках появляются три пункта:
- Публичные записи о том, какие сайты вы сканировали, когда и на каких условиях
- Механизмы для соблюдения robots.txt и явных сигналов opt-out
- Data lineage (история происхождения данных), способная пройти аудит через два года
Но вот в чем загвоздка: невозможно прикрутить комплаенс к пайплайну, который не знает, что и откуда он выгрузил. Команды, сделавшие скрапинг простым сайд-проектом, скоро поймут, что понятия "сайд-проект" и "готовность к аудиту" несовместимы.
Иными словами: выбор поставщика теперь включает вопрос "может ли ваш партнер по сбору данных предоставить прозрачный журнал аудита?". В 2024 году этого вопроса не было в большинстве списков требований. К третьему кварталу 2026 года он появится во всех серьезных чек-листах.
Вопрос к дата-брокерам стал сложнее
Bright Data отчиталась о годовой выручке более $300 млн с ростом свыше 50% в годовом исчислении, и они прямо заявили, что главным драйвером стал сбор данных для AI. Рынок легальных обучающих данных вырос, поскольку альтернатива (просто собирать все подряд) стала рискованнее по двум конкретным причинам.
Во-первых, расширилась юридическая плоскость. В феврале 2026 года Верховный суд отклонил патентную петицию Bright Data, и два их патента на резидентные proxy были признаны недействительными. Oxylabs подала встречный иск, при этом судебное заседание назначено на 18 мая 2026 года. Как бы вы ни оценивали суть спора, итог таков: начались дорогостоящие судебные разбирательства о методах сбора данных. Небольшие игроки, наблюдающие за этим, явно не расслабляются.
Во-вторых, усложнилась техническая сторона. Поставщики решений для защиты от ботов начали обмениваться данными об угрозах между сайтами клиентов в реальном времени. Паттерн скрапинга, помеченный на одном сайте электронной коммерции, может быть заблокирован на сотнях других за считанные часы (SecurityBoulevard, 2026). Старая тактика с ротацией дешевых proxy и надеждой на удачу перестала работать где-то в конце 2025 года. Мы разбирали этот сдвиг в материале о том, как обнаружение ботов перешло на поведенческий анализ.
Сложите все вместе: стоимость самостоятельного сбора данных для обучения моделей выросла по обоим направлениям. Юридические риски выросли. Техническая сложность выросла. Компании, которые все еще делают это своими силами, либо тратят серьезные деньги на инфраструктуру, либо смирились с тем, что их датасеты не пройдут аудит.
К чему все придет к середине 2027 года
Мы полагаем, что следующие 18 месяцев изменят рынок вендоров в трех аспектах.
Комплаенс становится базовым требованием. ISO 27001, SOC 2, процессы по стандарту GDPR, отслеживание происхождения данных (data lineage). Это больше не конкурентные преимущества, а необходимый минимум. У Bright Data уже есть ISO 27001 и SOC 2. Большинство их конкурентов пытаются их догнать. Команды, выпускающие серьезные AI продукты, откажутся подключать поставщика данных, не способного предоставить сертификаты.
Аудиторский след становится ключевой функцией. Большинство современных API для скрапинга возвращают данные и удаляют все остальное. К 2027 году значительная часть клиентов захочет иметь запись: исходный URL, время получения, код ответа, статус robots.txt на момент запроса, проверки на запрет сбора данных. Скучные метаданные, которые спасают при аудите, если законность модели поставят под сомнение.
Консолидация вендоров ускоряется. Расходы на комплаенс выгодны крупным игрокам. Небольшие API для скрапинга, выживающие за счет тарифов по $69 в месяц, либо уйдут в enterprise сегмент, либо будут вытеснены из любых сделок, связанных с обучением AI. Вендоры среднего сегмента, сочетающие комплаенс с разумными ценами, заберут освободившийся спрос. Расчет «разрабатывать или покупать», который мы разбирали в прошлом месяце, стал еще менее выгодным для собственной разработки.
Что это значит для инженерных команд
Если вы выпускаете AI продукт в ближайшие 12 месяцев, решения по источникам данных перестают быть просто вопросом инфраструктуры. Это вопрос юридических рисков и доступа на рынок.
Три вопроса к вашему текущему пайплайну:
Можете ли вы перечислить каждый домен, который сканировали за последние 12 месяцев, с временными метками? Если нет, вы не пройдете базовый аудит.
Учитываете ли вы сигналы opt-out в момент получения данных, а не на этапе обучения? Robots.txt и X-Robots-Tag больше не являются опциональными.
Если ваш поставщик данных изменит условия завтра, выживет ли ваш пайплайн обучения? Большинство команд даже не задавались этим вопросом.
Проверьте это прямо сейчас. Первые запросы на аудит уже приходят компаниям, которые думали, что у них есть еще год на подготовку.
Наша позиция
Compliance-by-design это не маркетинговый лозунг. Это вопрос выживания для любой команды, чей продукт зависит от веб-данных. Команды, которые уже сейчас относятся к data lineage как к задаче уровня P0, избавят себя от жесткой суеты в 2027 году. Команды, считающие это простой бумажной волокитой, со временем поймут, что именно эта волокита стоит между их продуктом и рынком.
Эпоха бесконтрольного сбора обучающих данных заканчивается не из-за вредности регуляторов. Она заканчивается потому, что последствия ошибок сменились с «неловкого поста в блоге» на «запрет на релиз в Европе». Это меняет расклад для всех участников цепочки поставок.