← Tất cả bài viết

Đạo luật AI của EU chấm dứt thời kỳ thu thập dữ liệu huấn luyện tự do

Việc thu thập dữ liệu huấn luyện AI vừa chuyển từ một vấn đề kỹ thuật sang vấn đề tuân thủ. Đạo luật AI của EU và sự giám sát ngày càng chặt chẽ đối với các nhà cung cấp sẽ định hình lại các quy tắc từ nay đến năm 2027.

Thời kỳ thu thập dữ liệu huấn luyện AI tự do đang khép lại

Vào giữa năm 2025, 75% lưu lượng web liên quan đến AI là hoạt động thu thập dữ liệu huấn luyện (Cloudflare Radar qua Bright Data, 2025). Không phải inference. Không phải tìm kiếm. Mà là huấn luyện. Các crawler liên tục lấy dữ liệu từ các trang web để nạp cho mô hình tiếp theo.

Kỷ nguyên đó đang dần khép lại.

Ba yếu tố đã cùng hội tụ trong sáu tháng qua. Các yêu cầu minh bạch của EU AI Act đã chuyển từ giai đoạn dự thảo sang thực thi bắt buộc. Các trang web bắt đầu chặn crawler AI trên diện rộng: 60% tên miền uy tín tính đến cuối năm 2025, tăng từ mức 23% vào tháng 9 năm 2023 (Ars Technica, 2025). Bên cạnh đó, bên mua dữ liệu huấn luyện đã bắt đầu đặt ra những câu hỏi mới về nguồn gốc dữ liệu.

Nếu bạn đang xây dựng một sản phẩm sử dụng dữ liệu scrape để huấn luyện mô hình, bạn đang đối mặt với một vấn đề mà phần lớn các đội ngũ phát triển vẫn chưa tính toán đến.

Những yêu cầu thực tế từ EU AI Act

Lộ trình triển khai năm 2026 đưa ra các yêu cầu minh bạch đối với nguồn dữ liệu huấn luyện AI (bản tóm tắt của Scalevise, 2026). Các nhà cung cấp mô hình AI đa mục đích phải công bố tóm tắt về những dữ liệu đã nạp vào mô hình. Tác giả và chủ sở hữu quyền có thể chọn từ chối (opt-out), và lựa chọn này phải được tôn trọng ngay tại tầng thu thập dữ liệu, thay vì tại tầng huấn luyện mô hình (khi mọi thứ đã quá muộn).

Trên thực tế, có ba hạng mục xuất hiện trong danh sách kiểm tra thu mua:

  • Bản ghi công khai về việc bạn đã crawl những trang web nào, vào thời điểm nào và theo quyền hạn nào
  • Cơ chế tuân thủ robots.txt và các tín hiệu opt-out rõ ràng
  • Khả năng truy xuất nguồn gốc dữ liệu (data lineage) đảm bảo vượt qua đợt kiểm toán trong hai năm tới

Nhưng vấn đề mấu chốt là: bạn không thể áp đặt tính tuân thủ vào một pipeline hoàn toàn không biết nó đã trích xuất dữ liệu gì từ đâu. Những đội ngũ xây dựng hạ tầng scraping như một dự án phụ sắp nhận ra rằng "dự án phụ" và "sẵn sàng kiểm toán" là hai điều không thể đi chung.

Điều này có nghĩa là: quy trình lựa chọn nhà cung cấp hiện bao gồm câu hỏi "liệu đối tác thu thập dữ liệu của bạn có thể cung cấp audit trail rõ ràng hay không?". Câu hỏi đó chưa từng nằm trên hầu hết các danh sách kiểm tra vào năm 2024. Nhưng nó sẽ có mặt trên mọi bản kiểm tra nghiêm túc vào quý 3 năm 2026.

Bài toán về bên môi giới dữ liệu trở nên phức tạp hơn

Bright Data báo cáo doanh thu quy năm đạt hơn 300 triệu USD với mức tăng trưởng hơn 50% so với cùng kỳ năm trước, và họ đã nêu rõ rằng mảng dữ liệu phục vụ AI chính là động lực thúc đẩy điều này. Thị trường dành cho dữ liệu huấn luyện tuân thủ quy định đã bùng nổ vì giải pháp thay thế (tự do scrape bất kỳ thứ gì bạn muốn) trở nên rủi ro hơn theo hai khía cạnh cụ thể.

Thứ nhất, phạm vi pháp lý đã mở rộng. Tòa án Tối cao đã bác đơn thỉnh cầu bằng sáng chế của Bright Data vào tháng 2 năm 2026, và hai bằng sáng chế proxy dân cư của họ bị tuyên vô hiệu. Oxylabs đã kiện ngược lại, với phiên tòa được ấn định vào ngày 18 tháng 5 năm 2026. Dù bạn đánh giá thế nào về bản chất vụ việc, kết quả thực tế là những vụ kiện tụng tốn kém xoay quanh cách thức thu thập dữ liệu. Các bên nhỏ hơn theo dõi diễn biến này không thể ngồi yên.

Thứ hai, phạm vi kỹ thuật cũng mở rộng. Các nhà cung cấp giải pháp phát hiện bot đã bắt đầu chia sẻ thông tin tình báo mối đe dọa (threat intel) theo thời gian thực giữa các trang web khách hàng. Một mẫu thu thập dữ liệu bị gắn cờ trên một trang thương mại điện tử có thể bị chặn trên hàng trăm trang khác chỉ sau vài giờ (SecurityBoulevard, 2026). Cách làm cũ là xoay vòng proxy giá rẻ và cầu may đã ngừng hiệu quả từ khoảng cuối năm 2025. Chúng tôi đã phân tích sự chuyển dịch đó trong bài phát hiện bot đã chuyển sang phân tích hành vi.

Tổng hợp lại: chi phí tự thu thập dữ liệu huấn luyện đã tăng lên ở cả hai khía cạnh. Rủi ro pháp lý tăng. Độ khó kỹ thuật tăng. Các công ty vẫn đang tự làm điều này hoặc là phải chi ngân sách thực sự lớn cho hạ tầng, hoặc phải chấp nhận rằng tập dữ liệu của họ sẽ không vượt qua được các đợt kiểm toán.

Xu hướng thị trường đến giữa năm 2027

Chúng tôi cho rằng 18 tháng tới sẽ tái định hình bức tranh nhà cung cấp theo ba hướng.

Tuân thủ trở thành yêu cầu bắt buộc. ISO 27001, SOC 2, các quy trình chuẩn GDPR, nguồn gốc dữ liệu (data lineage). Đây không còn là yếu tố khác biệt hóa mà là yêu cầu tối thiểu. Bright Data hiện đã có ISO 27001 và SOC 2. Phần lớn các đối thủ của họ đang phải chật vật theo kịp. Các đội ngũ triển khai sản phẩm AI nghiêm túc sẽ từ chối tích hợp nhà cung cấp thu thập dữ liệu không xuất trình được các chứng chỉ này.

Nhật ký kiểm toán trở thành một tính năng. Hầu hết các API thu thập dữ liệu hiện nay chỉ trả về dữ liệu thô và bỏ qua mọi thứ khác. Đến năm 2027, một lượng khách hàng đáng kể sẽ yêu cầu bản ghi chi tiết: URL nguồn, thời gian fetch, mã phản hồi, trạng thái robots.txt tại thời điểm fetch, việc kiểm tra tùy chọn từ chối (opt-out). Những siêu dữ liệu khô khan này sẽ trở thành phao cứu sinh về mặt tuân thủ khi mô hình bị khiếu nại.

Tốc độ hợp nhất nhà cung cấp tăng nhanh. Chi phí duy trì tuân thủ tạo lợi thế cho quy mô lớn. Các API thu thập dữ liệu nhỏ lẻ sống nhờ các gói 69 USD/tháng sẽ phải tiến lên phân khúc cao hơn hoặc bị loại khỏi bất kỳ thỏa thuận nào liên quan đến huấn luyện AI. Các nhà cung cấp tầm trung kết hợp được tính tuân thủ với mức giá hợp lý sẽ đón nhận lượng nhu cầu dịch chuyển này. Bài toán tự xây dựng hay đi mua mà chúng tôi đã phân tích tháng trước giờ đây càng trở nên bất lợi hơn cho phương án tự xây dựng.

Điều này có ý nghĩa gì đối với các đội ngũ kỹ thuật

Nếu bạn chuẩn bị ra mắt một sản phẩm AI trong 12 tháng tới, các quyết định về nguồn dữ liệu không còn đơn thuần là bài toán hạ tầng. Đó là vấn đề rủi ro pháp lý và quyền tiếp cận thị trường.

Ba câu hỏi cần đặt ra cho pipeline hiện tại của bạn:

  1. Bạn có thể liệt kê mọi domain mình đã crawl trong 12 tháng qua, kèm mốc thời gian không? Nếu không, bạn không thể vượt qua một đợt audit cơ bản.

  2. Bạn có tôn trọng các tín hiệu opt-out tại thời điểm fetch, chứ không phải lúc training không? Robots.txt và X-Robots-Tag không còn là tùy chọn nữa.

  3. Nếu nhà cung cấp dữ liệu thay đổi điều khoản vào ngày mai, training pipeline của bạn có còn hoạt động được không? Hầu hết các đội ngũ chưa từng đặt câu hỏi này.

Vì vậy hãy kiểm tra ngay bây giờ. Những yêu cầu audit đầu tiên đang bắt đầu gửi đến các công ty từng nghĩ họ còn một năm nữa để xử lý vấn đề này.

Quan điểm của chúng tôi

Tuân thủ theo thiết kế (Compliance-by-design) không phải là một câu marketing. Đó là quyết định sống còn cho bất kỳ đội ngũ nào có sản phẩm phụ thuộc vào dữ liệu web. Những đội ngũ coi data lineage là tính năng P0 ngay từ bây giờ sẽ tránh được một đợt xoay xở hỗn loạn vào năm 2027. Những đội ngũ coi đó chỉ là thủ tục giấy tờ cuối cùng sẽ nhận ra rằng, chính thủ tục giấy tờ đó là rào cản giữa sản phẩm của họ và thị trường.

Giai đoạn thu thập dữ liệu training tự do vô tội vạ sắp kết thúc không phải vì các cơ quan quản lý muốn gây khó dễ. Nó kết thúc vì hậu quả của việc làm sai đã chuyển từ "một bài blog đáng xấu hổ" thành "bạn không thể phân phối sản phẩm tại châu Âu". Điều đó thay đổi hoàn toàn bài toán kinh tế cho mọi mắt xích trong chuỗi cung ứng.