Web đang phân loại bot theo mục đích, không phải theo hành vi
Mọi hệ thống anti-bot được xây dựng trong mười lăm năm qua đều đặt ra một câu hỏi: lưu lượng truy cập này có vẻ tự động không? Thứ tự header, fingerprint ở tầng wire, chuyển động chuột, timing của session. Tất cả đều cố gắng suy luận điều gì đó về client từ hình thái của request.
Vào ngày 1 tháng 7 năm 2026, Cloudflare đã thay đổi câu hỏi. Lưu lượng bot hiện được chia thành ba danh mục không liên quan gì đến việc một request trông như thế nào trên đường truyền. Search bao gồm "các crawler lập chỉ mục nội dung để trả lời câu hỏi về nội dung đó sau này." Agent bao gồm "hoạt động tự động thay mặt một người trong thời gian thực." Training bao gồm "các crawler lấy nội dung của bạn để train hoặc fine-tune một model."
Hãy hình dung ba request đến cùng một server. Cùng client, cùng header, cùng timing, giống hệt nhau đến từng byte. Dưới mô hình này, chúng có thể nhận ba kết luận khác nhau, được quyết định hoàn toàn bởi những gì bạn dự định làm với trang web sau khi nhận được nó.
Đó không phải là một bộ detector tốt hơn. Đó là một primitive hoàn toàn khác.
Hạn chót 15 tháng 9 hẹp hơn sự hoảng loạn
Phiên bản của câu chuyện này đang lan truyền trên các diễn đàn lập trình viên là Cloudflare sẽ chặn các AI agent trên một phần năm web vào ngày 15 tháng 9.
Changelog nói về một điều nhỏ hơn nhiều. Các thiết lập mặc định mới chỉ áp dụng cho "các domain mới bắt đầu sử dụng Cloudflare." Trên các domain đó, "bot được phân loại là Training hoặc Agent sẽ bị chặn trên các trang hiển thị quảng cáo, trong khi Search vẫn được cho phép." Bất kỳ ai đang dùng Cloudflare đều tự chọn cài đặt của riêng mình và có thể thực hiện bất cứ lúc nào trước ngày đó.
Tóm lại: chỉ các domain mới, chỉ các trang có quảng cáo, và một trong ba danh mục vẫn được thông qua theo mặc định. Đó là một thay đổi thực sự, nhưng không phải là bức tường chắn ngang toàn bộ internet.
Nhưng phạm vi hẹp mới chính là phần thú vị. Cloudflare không công bố một chính sách, họ công bố một cài đặt mặc định, và mặc định là cách một chính sách trở thành chuẩn mực mà không cần ai bỏ phiếu. Con số đáng theo dõi không phải là ngày 15 tháng 9. Đó là việc có bao nhiêu domain trong số đó không bao giờ chạm vào cài đặt này sau đó.
Điều này có nghĩa là: nếu bạn thu thập dữ liệu, câu hỏi hữu ích không còn là "tôi có thể vượt qua lớp bảo vệ của trang này không" mà chuyển thành "trang web này nghĩ tôi đang thuộc danh mục nào." Chúng có những câu trả lời khác nhau và chỉ một trong số đó là thứ bạn có thể kiểm thử được.
Mục đích không thể đo lường. Nó phải được khai báo.
Vấn đề mang tính cơ học với việc phân loại lưu lượng theo ý định là: ý định không nằm trong packet.
Fingerprint có thể đo lường được. Chuyển động chuột có thể đo lường được. "Tại sao bạn lại tải trang này" thì không thể, vì vậy hệ thống cần client phải tự tuyên bố rõ ràng, và hệ thống cần một lý do để tin vào câu trả lời đó. Đó chính là nhiệm vụ của Web Bot Auth. Agent ký các request của mình bằng private key, công khai một thư mục khóa (key directory), và edge sẽ xác thực chữ ký dựa trên đó, được xây dựng trên RFC 9421 HTTP Message Signatures. Tài liệu của Cloudflare đặt ra tiêu chuẩn cho một bot đã xác thực là "tự nhận diện một cách trung thực."
Bây giờ hãy xem điều gì đang thực thi việc này trên quy mô lớn. Bản đặc tả kỹ thuật là draft-meunier-webbotauth-httpsig-protocol-02, sửa đổi lần cuối vào ngày 18 tháng 8 năm 2026. Trạng thái dự kiến: Standards Track. Trạng thái thực tế: một "Active Internet-Draft (individual)" vốn "không được IETF xác nhận" và "không có tư cách chính thức trong quy trình tiêu chuẩn của IETF." Nó có hai tác giả. Một người làm việc tại Cloudflare, một người làm việc tại Google.
Chúng tôi nghĩ thiết kế này là đúng đắn, và điều đó đáng được ghi nhận trước khi đưa ra các chỉ trích. Danh tính có chữ ký vượt trội hơn cuộc chạy đua vũ trang CAPTCHA đối với bất kỳ ai có ý định tuân thủ quy tắc. Một crawler tự khai báo danh tính có thể được cho phép, giới hạn tốc độ (throttle), hoặc tính phí một cách chủ động thay vì phải phỏng đoán, và các chủ sở hữu trang web có được một công cụ kiểm soát không gây ảnh hưởng ngoài ý muốn đến khách truy cập thực. Hãy so sánh điều đó với một thập kỷ chặn dải IP và hy vọng.
Điều nó không thể làm là ngăn chặn bất kỳ ai. Một hệ thống xây dựng dựa trên mục đích tự khai báo chỉ phân loại được lượng traffic tự khai báo. Mọi thứ khác đều quay trở lại stack phát hiện vốn đã có sẵn từ trước, và stack đó ngày càng trở nên sắc bén hơn: tính điểm hành vi theo phạm vi session (session-scoped behavioral scoring) của Cloudflare đã ra mắt mười hai ngày sau khi các danh mục mới xuất hiện.
Vì vậy cả hai không hề cạnh tranh nhau. Nhận diện danh tính xử lý những bên trung thực, phát hiện hành vi xử lý tất cả những đối tượng còn lại, và phần thứ hai chính là nơi traffic của bạn mặc định rơi vào nếu bạn không bao giờ khai báo bất cứ điều gì.
Không Có Phân Loại Nào Cho Việc Thu Thập Dữ Liệu Công Khai
Bây giờ là phần sẽ khiến bất kỳ ai đang vận hành một pipeline thu thập dữ liệu phải bận tâm.
Hãy nhìn vào các dự án chúng tôi đã công bố trong năm nay. Một chỉ số giá gỗ được xây dựng từ các danh sách công khai. Phát hiện vi phạm chính sách giá MAP trên sáu sàn thương mại điện tử, đồng nghĩa với việc tải cùng một trang sản phẩm từ sáu vị trí mạng khác nhau và so sánh nội dung của từng trang. Xếp hạng trên app store và phân tích cảm xúc đánh giá. Kiểm tra vị trí đặt quảng cáo được thực hiện từ chính quốc gia mà chiến dịch thực sự được mua.
Hãy thử xếp những trường hợp đó vào Search, Agent, hoặc Training.
Search không phù hợp: định nghĩa của chính Cloudflare đi kèm với kỳ vọng về "lưu lượng giới thiệu (referral traffic) hoặc hình thức đền bù công bằng khác", trong khi tác vụ kiểm tra giá hàng đêm không gửi referral cho ai cả. Agent cũng không phù hợp, vì không có người dùng nào đang ngồi trước màn hình chờ kết quả fetch đó. Và Training thì hoàn toàn sai, vì không có dữ liệu nào được đưa vào mô hình.
Đây là một hệ thống phân loại được tạo ra để mô tả lưu lượng AI xuất hiện trong ba năm qua, nhưng hiện lại được áp dụng cho một mảng kinh doanh đã tồn tại trước đó cả thập kỷ. Thu thập thông tin giá cả, dữ liệu thay thế (alternative data), theo dõi SERP, bảo vệ thương hiệu, xác minh quảng cáo, giám sát tuân thủ: không có thứ nào mới, không có thứ nào mang tính agentic, và không có thứ nào có một danh mục riêng phù hợp.
Lưu lượng không thuộc nhóm nào sẽ bị phân loại bởi chính bên đặt ra các nhóm đó. Thường là vào nhóm gần nhất.
Điều này có ý nghĩa gì đối với các đội ngũ dữ liệu
Bốn điều đáng làm khi các quy tắc vẫn chưa cố định.
Xác định danh mục bạn thực sự thuộc về một cách trung thực. Không phải danh mục giúp bạn vượt qua rào cản. Mà là danh mục bạn sẵn sàng bảo vệ bằng văn bản nếu một nhà xuất bản hỏi trực tiếp. Nếu câu trả lời trung thực là "không thuộc nhóm nào ở trên", thì bạn nằm trong nhóm chịu thiệt hại nhiều nhất khi hệ thống phân loại bị siết chặt, và cũng là nhóm hưởng lợi nhiều nhất khi lên tiếng trong lúc vẫn còn cơ hội thảo luận.
Đọc cài đặt của mục tiêu, đừng đọc tiêu đề báo chí. Chính sách bot của một trang web hiện là thuộc tính riêng của trang đó, có thể cấu hình theo từng path, và thay đổi bất cứ lúc nào mà không cần thông báo. Việc coi nhận định "Cloudflare chặn agent vào tháng 9" là thực tế áp dụng cho pipeline của bạn sẽ khiến bạn mất công xây dựng lại những thứ vốn chưa từng gặp rủi ro.
Giả định rằng cơ chế kiểm tra trang quảng cáo sẽ lan rộng. Cloudflare gắn mặc định của mình với các trang hiển thị quảng cáo, một đại diện hợp lý cho "trang này kiếm tiền từ sự chú ý của con người". Ranh giới đó sẽ thay đổi, và Cloudflare không phải là bên duy nhất đặt ra ranh giới này. AWS WAF đã ra mắt tính năng kiếm tiền từ lưu lượng AI vào ngày 15 tháng 6 năm 2026, phản hồi bằng mã 402 và các điều khoản thanh toán mà máy có thể đọc được. Akamai chọn con đường hợp tác với TollBit và Skyfire. Ba trong số các nhà cung cấp edge lớn nhất hiện đang bán cùng một bề mặt kiểm soát, điều mà chúng tôi đã phân tích từ khía cạnh định giá khi mô hình pay-per-crawl ra mắt.
Đảm bảo hệ thống thu thập dữ liệu của bạn hoạt động được ở cả hai làn. Làn có định danh (ký xác thực, khai báo, được cho phép hoặc bị tính phí) và làn không định danh (bị đánh giá dựa trên hành vi, như thường lệ) sẽ cùng tồn tại trong nhiều năm. Xây dựng hệ thống như thể chỉ có một trong hai làn tồn tại là một sai lầm tốn kém, dù theo bất kỳ hướng nào.
Các danh mục sẽ được phân chia lại
Một dự đoán mà chúng tôi sẵn sàng chịu trách nhiệm: danh mục thứ tư sẽ xuất hiện trong vòng một năm tới.
Phiên bản đầu tiên của bất kỳ hệ thống phân loại nào cũng được viết ra bởi bên đang chịu áp lực, và những đối tượng bị phân loại lại không có mặt ở đó khi điều này diễn ra. Search, Agent và Training mô tả những gì các công ty AI tác động lên phía nhà xuất bản nội dung. Chúng không phản ánh đúng một công ty nghiên cứu thị trường, một đội ngũ compliance, hay một nhà bán lẻ đang kiểm tra giá niêm yết của đối thủ, và cả ba nhóm này vốn đã thu thập các trang công khai một cách chuẩn mực từ rất lâu trước khi khái niệm "agent" mang bất kỳ ý nghĩa nào trong ngữ cảnh hiện tại.
Cuộc tranh luận xoay quanh việc ô tùy chọn thứ tư đó được gọi là gì, và ai có quyền gắn nhãn vào nó, sẽ có tầm ảnh hưởng tới ngành công nghiệp dữ liệu lớn hơn bất kỳ benchmark chống bot nào được công bố trong năm nay. Đó là cuộc đua xứng đáng để tham gia.
Bởi vì phương án dự phòng rất rõ ràng. Nếu lưu lượng truy cập của bạn không thể tự định danh chính nó, một bên khác sẽ đặt tên thay cho bạn.