← Wszystkie wpisy

EU AI Act kończy samowolkę w kwestii danych treningowych

Zbieranie danych treningowych dla AI właśnie przestało być problemem technicznym, a stało się kwestią zgodności z przepisami. EU AI Act i rosnące wymagania wobec dostawców zmieniają reguły gry do 2027 roku.

Samowolka w pozyskiwaniu danych treningowych do AI dobiega końca

W połowie 2025 roku 75% ruchu internetowego związanego z AI stanowiło zbieranie danych treningowych (Cloudflare Radar via Bright Data, 2025). Nie inferencja. Nie wyszukiwanie. Trening. Crawlery pobierające strony, aby nakarmić kolejny model.

Ta era się kończy.

W ciągu ostatnich sześciu miesięcy zbiegły się trzy czynniki. Wymogi przejrzystości unijnego aktu o sztucznej inteligencji (EU AI Act) przeszły z fazy projektowej do egzekwowalnej. Serwisy zaczęły masowo blokować crawlery AI: 60% renomowanych domen pod koniec 2025 roku, w porównaniu z 23% we wrześniu 2023 roku (Ars Technica, 2025). Z kolei nabywcy danych treningowych zaczęli zadawać nowe pytania o ich pochodzenie.

Jeśli budujesz produkt wykorzystujący scrapowane dane do trenowania modeli, stajesz przed problemem, którego większość zespołów jeszcze nie uwzględniła w kosztach.

Czego w rzeczywistości wymaga EU AI Act

Wdrożenie przepisów w 2026 roku wprowadza wymogi przejrzystości dotyczące źródeł danych do trenowania AI (Scalevise summary, 2026). Dostawcy modeli AI ogólnego przeznaczenia muszą publikować podsumowania materiałów użytych do ich wytrenowania. Autorzy i właściciele praw mogą zgłosić sprzeciw (opt-out), a decyzja ta musi być respektowana na warstwie zbierania danych, a nie na etapie trenowania modelu (kiedy jest już za późno).

W praktyce na listach kontrolnych w działach zakupów pojawiają się trzy kwestie:

  • Publiczne rejestry wskazujące, które witryny crawlowano, kiedy i na jakich uprawnieniach
  • Mechanizmy respektujące robots.txt oraz bezpośrednie sygnały opt-out
  • Pochodzenie danych (data lineage), które wytrzyma audyt za dwa lata

Haczyk polega na tym, że nie da się dokleić zgodności z przepisami do pipeline'u, który nie rejestruje, co i skąd pobrał. Zespoły, które potraktowały scraping jako projekt poboczny, wkrótce przekonają się, że określenia "projekt poboczny" i "gotowość do audytu" wzajemnie się wykluczają.

W praktyce: wybór dostawcy obejmuje teraz pytanie "czy wasz partner w zbieraniu danych może przedstawić rzetelną ścieżkę audytu?". W 2024 roku to pytanie rzadko trafiało na listy kontrolne. Do trzeciego kwartału 2026 roku pojawi się na każdej z nich.

Pytanie o brokerów danych stało się trudniejsze

Firma Bright Data zaraportowała ponad 300 mln USD rocznego przychodu przy wzroście przekraczającym 50% rok do roku i wyraźnie zaznaczyła, że głównym motorem tego wzrostu są dane dla AI. Rynek zgodnych z prawem danych treningowych gwałtownie urósł, ponieważ alternatywa (scrapowanie czegokolwiek bez ograniczeń) stała się bardziej ryzykowna z dwóch konkretnych powodów.

Po pierwsze, rozszerzył się obszar ryzyka prawnego. Sąd Najwyższy odrzucił wniosek patentowy Bright Data w lutym 2026 roku, a dwa z ich patentów na residential proxy zostały unieważnione. Oxylabs złożył pozew wzajemny, a rozprawę wyznaczono na 18 maja 2026 roku. Niezależnie od oceny zasadności, efektem są kosztowne spory sądowe dotyczące metod pozyskiwania danych. Mniejsi gracze obserwujący sytuację nie mogą spać spokojnie.

Po drugie, zwiększył się stopień skomplikowania technicznego. Dostawcy rozwiązań bot-detection zaczęli wymieniać się danymi o zagrożeniach w czasie rzeczywistym między serwisami klientów. Wzorzec scrapingu oznaczony na jednej stronie e-commerce może zostać zablokowany na setkach innych w ciągu kilku godzin (SecurityBoulevard, 2026). Stara strategia rotowania tanich proxy i liczenia na szczęście przestała działać pod koniec 2025 roku. Opisaliśmy tę zmianę w tekście bot detection went behavioral.

Podsumowując: koszt samodzielnego zbierania danych treningowych wzrósł na obu płaszczyznach. Wzrosła ekspozycja prawna. Wzrosły trudności techniczne. Firmy, które nadal robią to same, albo wydają realne pieniądze na infrastrukturę, albo godzą się z tym, że ich zbiory danych nie przetrwają audytu.

Dokąd to zmierza do połowy 2027 roku

Uważamy, że najbliższe 18 miesięcy przekształci rynek dostawców na trzy sposoby.

Zgodność staje się warunkiem koniecznym. ISO 27001, SOC 2, procesy zgodne z RODO, data lineage. To nie wyróżniki, lecz minimalne wymagania. Bright Data posiada już ISO 27001 oraz SOC 2. Większość ich konkurentów próbuje nadrobić zaległości. Zespoły wdrażające poważne produkty AI odmówią współpracy z dostawcą danych, który nie jest w stanie przedstawić odpowiednich certyfikatów.

Ścieżki audytu stają się kluczową funkcją. Większość obecnych API do scrapingu zwraca dane i odrzuca całą resztę. Do 2027 roku znaczna część klientów będzie wymagać rejestru: źródłowego URL, czasu pobrania, kodu odpowiedzi, stanu robots.txt w momencie zapytania oraz weryfikacji mechanizmów opt-out. Nudne metadane stają się deską ratunkową w kwestiach formalnych, gdy model zostanie zakwestionowany.

Konsolidacja dostawców przyspiesza. Narzut związany ze zgodnością faworyzuje dużą skalę działania. Małe API do scrapingu utrzymujące się z planów za 69 USD miesięcznie albo przejdą do segmentu enterprise, albo zostaną wyeliminowane z jakichkolwiek transakcji powiązanych z trenowaniem AI. Średniej wielkości dostawcy, którzy łączą zgodność z rozsądnymi cenami, przejmą ten popyt. Bilans zysków i strat dla budowy własnego rozwiązania, który omówiliśmy w zeszłym miesiącu, stał się jeszcze mniej korzystny dla tworzenia systemów in-house.

Co to oznacza dla zespołów inżynieryjnych

Jeśli wdrażasz produkt AI w ciągu najbliższych 12 miesięcy, decyzje o źródłach danych nie są już tylko kwestią infrastruktury. Są kwestią ryzyka prawnego i dostępu do rynku.

Trzy pytania, które warto zadać w odniesieniu do obecnego pipeline'u:

  1. Czy jesteś w stanie wymienić każdą domenę scrapowaną w ciągu ostatnich 12 miesięcy, wraz ze znacznikami czasu? Jeśli nie, nie przejdziesz podstawowego audytu.

  2. Czy respektujesz sygnały rezygnacji (opt-out) na etapie pobierania danych, a nie podczas trenowania modelu? Robots.txt i X-Robots-Tag nie są już opcjonalne.

  3. Jeśli Twój dostawca danych zmieni jutro warunki licencji, czy Twój pipeline treningowy przetrwa? Większość zespołów nawet o to nie zapytała.

Sprawdź to teraz. Pierwsze wnioski o audyt trafiają do firm, które myślały, że mają jeszcze rok na uporządkowanie tych kwestii.

Nasze stanowisko

Compliance-by-design to nie jest hasło marketingowe. To decyzja o przetrwaniu dla każdego zespołu, którego produkt zależy od danych z sieci. Zespoły, które już teraz traktują pochodzenie danych (data lineage) jako feature o priorytecie P0, zaoszczędzą sobie brutalnej walki z czasem w 2027 roku. Zespoły, które widzą w tym tylko papierkową robotę, przekonają się w końcu, że ta papierkowa robota stoi między ich produktem a rynkiem.

Samowolka w kwestii danych treningowych nie kończy się dlatego, że regulatorzy są złośliwi. Kończy się, ponieważ konsekwencje błędów przeszły z kategorii "żenujący post na blogu" do "zakaz wdrażania produktu w Europie". To zmienia kalkulację dla każdego podmiotu w łańcuchu dostaw.