Vào ngày 19 tháng 2 năm 2026, Stack Overflow và Cloudflare đã công bố một điều mà phần lớn ngành dữ liệu web không lường trước được. Họ đồng ra mắt pay-per-crawl: một hệ thống nơi các bot thu thập dữ liệu AI nhận được phản hồi 402 Payment Required theo thời gian thực và có thể chọn trả mức giá của nhà xuất bản hoặc rời đi. Danh tính của bot được xác thực tại edge, giá do trang web quyết định, giao dịch được đo lường theo lưu lượng.
Cloudflare đứng trước khoảng một phần năm số trang web trên internet. Vì vậy, khi họ chuyển sang chế độ chặn theo mặc định đối với các bot AI đã biết và dựng lên một sàn giao dịch nơi các nhà xuất bản tính phí trên từng request, mô hình truy cập cho một phần lớn web mở đã thay đổi chỉ sau một ngày cuối tuần.
Nếu bạn đang phát triển hạ tầng dữ liệu web vào lúc này, đây không phải là một thông báo từ Cloudflare để bạn bỏ qua. Nó làm thay đổi bài toán về ý nghĩa thực sự của "mở".
Cơ chế đằng sau sự thay đổi
Về mặt kỹ thuật, thay đổi này không lớn. Cloudflare đã khôi phục lại mã trạng thái HTTP 402, "Payment Required" vốn bị lãng quên từ lâu, và kết nối nó với một danh bạ các bot AI đã được xác minh. Nhà xuất bản đặt mức giá cho mỗi request. Bot thu thập dữ liệu hoặc duy trì số dư tín dụng để thanh toán, hoặc bị chặn.
Về mặt phi kỹ thuật, bước đi này lớn hơn nhiều. Trước đây, những cách duy nhất để thực thi yêu cầu "không cào nội dung của tôi cho AI" là robots.txt (chỉ mang tính khuyến nghị, không bắt buộc) và chặn bot quyết liệt (nhị phân, dễ tổn thất và đầy rủi ro nhận diện nhầm). Cloudflare đã thêm vào một lựa chọn thứ ba: gắn thẻ giá.
Tính kinh tế của lựa chọn thứ ba này vận hành khác hẳn hai lựa chọn đầu. Robots.txt không tốn chi phí và bị phớt lờ. Chặn bot khiến bạn mất lưu lượng từ người dùng thật bị phân loại nhầm thành bot. Việc gắn thẻ giá, theo thiết kế, sẽ tách biệt các bot sẵn sàng trả tiền khỏi các bot không chịu chi.
Những ai đang thực sự thu phí
Stack Overflow là đối tác ra mắt vì dữ liệu huấn luyện của họ thực sự có giá trị và họ vốn đã đàm phán các thỏa thuận song phương với OpenAI cùng nhiều bên khác. Sàn giao dịch của Cloudflare đã tổng quát hóa các thỏa thuận song phương đó thành một danh bạ mà phần còn lại của giới xuất bản có thể tích hợp vào.
Danh sách những bên theo sau tăng nhanh chóng. AWS đã phát hành lớp kiếm tiền từ bot của riêng mình. Akamai xây dựng một lớp tương tự song song. Lời chào mời dành cho các nhà xuất bản rất rõ ràng: thay vì một vụ kiện tốn kém chống lại một lab AI, hãy tạo ra một nguồn doanh thu được chi trả trên từng request.
Hiện tại, điều này chủ yếu áp dụng cho nhóm nội dung giá trị cao: tài liệu kỹ thuật, tin tức, hỏi đáp chuyên ngành, dữ liệu tham chiếu có cấu trúc. Phần đuôi dài (long tail) của web (các trang thương mại điện tử nhỏ, danh bạ khu vực, diễn đàn ngách) không nằm sau cánh cổng nào như vậy và có thể sẽ không bao giờ như thế. Bản thân việc vận hành quản lý bot của Cloudflare cũng tốn chi phí, và pay-per-crawl là tính năng tùy chọn. Nó chỉ đem lại lợi nhuận cho các trang web nơi mỗi lượt xem trang đơn lẻ đều đáng để tính phí.
Điều này có ý nghĩa gì đối với các pipeline dữ liệu web
Nếu bạn đang xây dựng một pipeline thu thập dữ liệu từ Stack Overflow, các trang tin tức lớn hoặc bất kỳ nhà xuất bản nào đang tích cực tham gia hệ thống này, các lựa chọn của bạn sẽ thu hẹp lại còn ba. Trả phí qua marketplace khi lưu lượng truy cập của bạn bị nhận diện là AI crawler. Chuyển sang một bộ dữ liệu đã được cấp phép nếu có sẵn. Hoặc tìm kiếm dữ liệu ở nơi nó vẫn còn mở.
Hầu hết các nhóm kỹ thuật sẽ phải thực hiện cả ba cách vào các thời điểm khác nhau. Đó là thực tế. Web đang bị chia tách thành phần có bản quyền và phần mở, ranh giới này không được phân định rõ ràng theo từng domain. Cùng một nhà xuất bản có thể đặt một phần nội dung sau mã 402 và để mở một phần khác. Cùng một trang web có thể tính phí một crawler này nhưng lại bỏ qua hoàn toàn một bot nghiên cứu.
Chúng tôi cho rằng phản ứng thực tế của các nhóm kỹ thuật nên như sau. Đầu tiên, hãy kiểm tra lại các nguồn dữ liệu của bạn. Nếu một phần đáng kể trong pipeline của bạn lấy dữ liệu từ Stack Overflow, Reddit, các trang tin tức lớn hoặc bất kỳ nhà xuất bản nào trong số hàng chục đơn vị đang công khai tìm kiếm các thỏa thuận này, hãy xác định rằng mô hình truy cập sẽ thay đổi trong vòng mười hai tháng tới. Thứ hai, hãy tách biệt các nguồn có bản quyền khỏi các nguồn mở ngay từ sớm trong kiến trúc của bạn. Một pipeline xử lý mọi nguồn dữ liệu như nhau sẽ rất mong manh khi một nửa trong số đó bắt đầu yêu cầu trả phí còn nửa kia thì không. Thứ ba, ngừng xem robots.txt là tín hiệu duy nhất. Phản hồi 402 sẽ mang ý nghĩa nhất định về mặt vận hành ngay cả khi crawler của bạn không phải là một AI agent. Việc nhận diện nhầm là điều khó tránh khỏi trong một hệ thống còn mới như thế này.
Điều này song hành cùng áp lực tuân thủ dữ liệu huấn luyện từ Đạo luật AI của EU (EU AI Act), vốn đã thúc đẩy các nhóm chuyển hướng sang những nguồn có thể truy xuất nguồn gốc. Pay-per-crawl chính là áp lực tương tự nhưng có thêm một lớp thanh toán đi kèm.
Nhìn nhận thẳng thắn
Có một vài điểm sẽ gây khó khăn. Việc xác minh danh tính của Cloudflare dựa vào việc bot tự đăng ký. Những bot không đăng ký, hoặc những bot trông giống như lưu lượng truy cập dân cư, hoàn toàn không kích hoạt mã 402. Thay vào đó, chúng sẽ gặp các hệ thống bot detection thông thường. Đó vốn là con đường mà hầu hết các AI crawler hung hãn sẽ chọn. Vì vậy pay-per-crawl chỉ hiệu quả với những bot muốn tuân thủ. Những bot không muốn tuân thủ thì vốn dĩ cũng chưa từng tôn trọng robots.txt.
Sự thay đổi lớn hơn có thể không nằm ở bản thân marketplace. Đó là câu hỏi "nội dung này có thể dùng để huấn luyện AI hay không" đã có câu trả lời bằng hợp đồng thay vì chỉ là sự phỏng đoán dựa trên robots.txt. Các nhà xuất bản cuối cùng đã có thể thực thi quyền kiểm soát. Các crawler cuối cùng cũng biết rõ giới hạn. Vùng xám sẽ thu hẹp lại ở những nơi mà marketplace tiếp cận tới.
Những gì vẫn nằm trong vùng xám là mọi thứ bên ngoài phạm vi đó. Trang web nhỏ không dùng Cloudflare, trang tổng hợp tin khu vực không có chiến lược AI, phần long-tail của thế giới web mà không ai thèm đàm phán: những đối tượng này không nhận được mã 402, và họ cũng không có thỏa thuận cấp phép nào. Họ giữ nguyên bất kỳ chính sách truy cập nào từng có trước đây, chỉ là với sự phản đối gay gắt hơn khi giờ đây đã có tiền lệ về việc đền bù.
Xu hướng tiếp theo
Hai dự đoán, và chúng không phải là những dự đoán an toàn.
Một là: mười hai tháng tới sẽ chứng kiến tầng paywall thứ hai, lần này dành cho bot phi AI. Cơ chế thị trường chỉ là một mã trạng thái HTTP và một lớp thanh toán. Về mặt kỹ thuật, không khó để mở rộng sang định giá cho bot thu thập của công cụ tìm kiếm, bot lưu trữ, hoặc bot theo dõi đối thủ cạnh tranh. Việc các nhà xuất bản có giữ nguyên giới hạn chỉ tính phí AI crawler hay không phụ thuộc vào cách làn sóng tiếp theo vận hành. Phần lớn các năm, giới hạn đó đều bị phá vỡ.
Hai là: các phòng lab AI sẽ tìm cách đi vòng qua nó. Không phải bằng cách phớt lờ lỗi 402 (điều này dễ bị truy vết và kiện tụng), mà bằng cách mua hàng loạt bộ dữ liệu có bản quyền rồi chuyển toàn bộ lưu lượng còn lại qua luồng truy cập trông như người dùng thật. Cloudflare hiện đã triển khai thêm nhiều tính năng phát hiện hành vi chính vì họ hiểu rõ điều này. Chúng tôi đã theo dõi cuộc chạy đua vũ trang đó chuyển dịch sang các tín hiệu cấp phiên truy cập trong suốt hai năm qua. Mọi chuyện không kết thúc ở một sàn giao dịch.
Câu hỏi thú vị dành cho các builder không phải là có nên trả tiền hay không. Mà là web mở sẽ tiếp tục mở ở đâu, và trong bao lâu.