← Tất cả bài viết

Search, Agent, Training: Quy tắc bot mới của Web

Cloudflare hiện phân loại bot theo mục đích thay vì hành vi: Search, Agent hoặc Training. Mặc định ngày 15 tháng 9 hẹp hơn mức độ hoảng loạn thực tế, và vẫn còn thiếu một ô.

Web đang phân loại bot theo mục đích, không phải theo hành vi

Mọi hệ thống phát hiện bot được xây dựng trong 15 năm qua đều đặt ra một câu hỏi: lưu lượng này có dấu hiệu tự động hóa không? Thứ tự header, fingerprint ở cấp độ truyền dẫn, chuyển động chuột, thời gian phiên. Tất cả đều cố gắng suy luận điều gì đó về client từ cấu trúc của request.

Vào ngày 1 tháng 7 năm 2026, Cloudflare đã thay đổi câu hỏi. Lưu lượng bot hiện được chia thành ba danh mục hoàn toàn không liên quan đến hình thức của request trên đường truyền. Search bao gồm "crawler lập chỉ mục nội dung của bạn để trả lời các câu hỏi về nội dung đó sau này." Agent bao gồm "hoạt động tự động xử lý theo thời gian thực thay mặt cho người dùng." Training bao gồm "crawler thu thập nội dung của bạn để huấn luyện hoặc tinh chỉnh mô hình."

Hãy hình dung ba request cùng gửi đến một server. Cùng một client, cùng header, cùng thời gian, giống hệt nhau đến từng byte. Theo mô hình này, chúng có thể nhận ba kết quả phân loại khác nhau, được quyết định hoàn toàn bởi những gì bạn dự định làm với trang web sau khi nhận được dữ liệu.

Đó không phải là một công cụ phát hiện tốt hơn. Đó là một khái niệm nền tảng hoàn toàn khác.

Hạn chót ngày 15 tháng 9 có phạm vi hẹp hơn sự hoang mang của cộng đồng

Thông tin đang lan truyền trên các diễn đàn lập trình viên là Cloudflare sẽ chặn các AI agent trên một phần năm trang web toàn cầu vào ngày 15 tháng 9.

Nhật ký thay đổi (changelog) lại nêu một phạm vi hẹp hơn nhiều. Các giá trị mặc định mới chỉ áp dụng cho "các domain mới bắt đầu tích hợp vào Cloudflare." Trên các domain đó, "các bot được phân loại là Training hoặc Agent sẽ bị chặn trên các trang hiển thị quảng cáo, trong khi Search vẫn được cho phép." Bất kỳ ai đang dùng Cloudflare đều tự chọn cấu hình của riêng mình, và có thể thực hiện bất cứ lúc nào trước thời hạn.

Tóm lại: chỉ domain mới, chỉ các trang có quảng cáo, và một trong ba danh mục vẫn được thông qua theo mặc định. Đây là một thay đổi thực sự, nhưng không phải là một bức tường chặn đứng toàn bộ internet.

Tuy nhiên, phạm vi hẹp mới chính là điểm đáng chú ý. Cloudflare không công bố một chính sách bắt buộc, họ công bố một giá trị mặc định, và giá trị mặc định chính là cách một chính sách trở thành tiêu chuẩn chung mà không cần ai bỏ phiếu thông qua. Con số đáng theo dõi không phải là ngày 15 tháng 9. Đó là có bao nhiêu domain trong số đó không bao giờ chỉnh sửa lại cài đặt này sau đó.

Điều này có ý nghĩa gì: nếu bạn thu thập dữ liệu, câu hỏi hữu ích không còn là "tôi có thể vượt qua lớp bảo vệ của trang này không", mà là "trang này đang xếp tôi vào danh mục nào". Hai câu hỏi này có câu trả lời khác nhau, và bạn chỉ có thể kiểm tra thực tế được một trong hai.

Mục đích không thể đo lường được. Nó phải được khai báo.

Đây là vấn đề kỹ thuật cốt lõi khi phân loại lưu lượng theo ý định: ý định không nằm trong gói tin.

Fingerprint có thể đo lường được. Chuyển động chuột có thể đo lường được. "Tại sao bạn lại tải trang này" thì không thể đo lường, vì vậy hệ thống cần client tự nói rõ mục đích, và hệ thống cần một lý do để tin vào câu trả lời đó. Đó chính là nhiệm vụ của Web Bot Auth. Agent ký các request của nó bằng một private key, công khai một thư mục khóa (key directory), và edge sẽ xác minh chữ ký dựa trên thư mục đó, được xây dựng trên RFC 9421 HTTP Message Signatures. Tài liệu của Cloudflare đặt ra tiêu chuẩn cho một verified bot là "tự nhận diện một cách trung thực."

Bây giờ hãy nhìn vào những gì đang thực thi điều này ở quy mô lớn. Bản đặc tả là draft-meunier-webbotauth-httpsig-protocol-02, sửa đổi lần cuối vào ngày 18 tháng 8 năm 2026. Trạng thái dự kiến: Standards Track. Trạng thái thực tế: một "Active Internet-Draft (individual)" thuộc diện "không được IETF xác nhận" và "không có vị thế chính thức trong quy trình chuẩn hóa của IETF." Nó có hai tác giả. Một người làm việc tại Cloudflare, một người làm việc tại Google.

Chúng tôi nghĩ thiết kế này là đúng đắn, và điều đó đáng được khẳng định trước khi đưa ra các chỉ trích. Danh tính có chữ ký vượt trội hơn cuộc chạy đua vũ trang với các trang xác minh đối với bất kỳ ai có ý định hoạt động nghiêm túc. Một crawler tự khai báo danh tính có thể được cho phép, giới hạn tốc độ (throttled), hoặc tính phí một cách chủ động thay vì phải phỏng đoán, và chủ sở hữu trang web có được một công cụ kiểm soát không gây ảnh hưởng ngoài ý muốn đến người dùng thật. Hãy so sánh điều đó với một thập kỷ chặn các dải IP và cầu may.

Điều nó không thể làm là ngăn chặn bất kỳ ai. Một hệ thống xây dựng dựa trên mục đích tự khai báo chỉ phân loại được lượng traffic tự khai báo. Mọi traffic khác đều rơi trở lại stack phát hiện vốn đã tồn tại từ trước, và stack đó ngày càng trở nên sắc bén hơn: tính điểm hành vi theo phạm vi session của Cloudflare đã được ra mắt mười hai ngày sau khi các danh mục mới xuất hiện.

Vì vậy hai cơ chế này không cạnh tranh nhau. Danh tính phân loại những bên trung thực, phát hiện xử lý những bên còn lại, và cơ chế thứ hai là nơi traffic của bạn sẽ rơi vào theo mặc định nếu bạn không khai báo bất kỳ điều gì.

Không Có Danh Mục Dành Cho Việc Thu Thập Dữ Liệu Công Khai

Bây giờ là phần sẽ khiến bất kỳ ai đang vận hành một pipeline thu thập dữ liệu phải băn khoăn.

Hãy xem những nghiên cứu chúng tôi đã công bố trong năm nay. Một chỉ số giá gỗ được xây dựng từ các danh sách niêm yết công khai. Phát hiện vi phạm chính sách giá MAP trên sáu sàn thương mại điện tử, đồng nghĩa với việc tải cùng một trang sản phẩm từ sáu vị trí địa lý khác nhau và so sánh nội dung hiển thị ở từng nơi. Xếp hạng trên app store và phân tích cảm xúc đánh giá. Kiểm tra vị trí đặt quảng cáo được chạy từ đúng quốc gia mà chiến dịch thực sự được mua.

Hãy thử phân loại những tác vụ đó vào Search, Agent, hoặc Training.

Search không phù hợp: định nghĩa của chính Cloudflare gắn liền với kỳ vọng về "lưu lượng truy cập giới thiệu hoặc khoản bồi thường công bằng khác đổi lại", và việc kiểm tra giá hàng đêm không gửi lượt giới thiệu cho ai cả. Agent cũng không phù hợp, vì không có người dùng nào ngồi trước màn hình chờ kết quả fetch đó. Và Training rõ ràng là sai, vì không có dữ liệu nào được nạp vào mô hình.

Đây là một hệ thống phân loại được tạo ra để mô tả lưu lượng AI xuất hiện trong ba năm qua, nay lại áp dụng cho một ngành kinh doanh đã tồn tại trước đó cả thập kỷ. Phân tích giá, dữ liệu thay thế, theo dõi SERP, bảo vệ thương hiệu, xác minh quảng cáo, giám sát tuân thủ: không có thứ nào mới, không có thứ nào mang tính agentic, và không có thứ nào có sẵn một danh mục phù hợp để chọn.

Lưu lượng không có danh mục phù hợp sẽ bị phân loại bởi chính người tạo ra các danh mục đó. Thường là bị xếp vào danh mục gần giống nhất.

Ý Nghĩa Đối Với Các Đội Ngũ Dữ Liệu

Bốn việc đáng làm khi các quy tắc vẫn chưa cố định.

Quyết định danh mục bạn có thể nhận một cách trung thực. Không phải danh mục giúp bạn lọt qua cổng kiểm soát. Mà là danh mục bạn sẵn sàng bảo vệ bằng văn bản nếu một publisher hỏi trực tiếp. Nếu câu trả lời trung thực là "không thuộc danh mục nào trong số này", bạn thuộc nhóm chịu thiệt hại nhiều nhất khi hệ thống phân loại cố định lại, và cũng là nhóm hưởng lợi nhiều nhất khi lên tiếng ngay lúc các bên vẫn còn đang tranh luận.

Đọc kỹ cấu hình của mục tiêu, đừng đọc tiêu đề báo chí. Chính sách bot của một trang web hiện là thuộc tính riêng của trang đó, có thể cấu hình theo từng path và thay đổi mà không cần báo trước. Việc coi nhận định "Cloudflare chặn bot agent vào tháng 9" như một sự thật áp dụng cho toàn bộ pipeline sẽ khiến bạn phải xây dựng lại những hệ thống vốn chưa từng gặp rủi ro.

Chuẩn bị cho việc quy tắc trang quảng cáo được nhân rộng. Cloudflare đã gắn cấu hình mặc định với các trang hiển thị quảng cáo, một dấu hiệu hợp lý cho "trang này kiếm tiền từ sự chú ý của con người". Ranh giới đó sẽ dịch chuyển, và Cloudflare không phải là bên duy nhất thiết lập nó. AWS WAF đã ra mắt kiếm tiền từ lưu lượng AI vào ngày 15 tháng 6 năm 2026, phản hồi bằng mã 402 kèm theo các điều khoản thanh toán máy có thể đọc được. Akamai chọn hướng hợp tác với TollBit và Skyfire. Ba trong số các nhà cung cấp edge lớn nhất hiện đang bán cùng một bề mặt kiểm soát, điều mà chúng tôi đã phân tích dưới góc độ định giá khi mô hình pay-per-crawl ra mắt.

Đảm bảo hệ thống thu thập dữ liệu có thể hoạt động trên cả hai luồng. Luồng định danh (ký xác thực, khai báo, được cho phép hoặc bị tính phí) và luồng không định danh (bị đánh giá dựa trên hành vi, như từ trước đến nay) sẽ cùng tồn tại trong nhiều năm. Việc thiết kế hệ thống như thể chỉ có một luồng duy nhất tồn tại là một sai lầm tốn kém, dù theo bất kỳ hướng nào.

Các Phân Loại Sẽ Được Tái Thiết Lập

Một dự đoán mà chúng tôi sẵn sàng chịu trách nhiệm: một danh mục thứ tư sẽ xuất hiện trong vòng một năm tới.

Phiên bản đầu tiên của bất kỳ hệ thống phân loại nào cũng được viết bởi bất kỳ ai đang chịu áp lực, và những đối tượng bị phân loại lại không có mặt khi điều đó diễn ra. Search, Agent và Training mô tả những gì các công ty AI thực hiện đối với các nhà xuất bản nội dung. Chúng không phản ánh đúng hoạt động của một công ty nghiên cứu thị trường, một đội ngũ compliance, hay một nhà bán lẻ đang kiểm tra giá niêm yết của đối thủ, và cả ba nhóm này đều đã thu thập các trang công khai một cách lịch sự từ trước khi thuật ngữ "agent" mang bất kỳ ý nghĩa nào trong ngữ cảnh này.

Cuộc tranh luận về việc ô phân loại thứ tư đó được gọi là gì, và ai có quyền lựa chọn nó, sẽ quan trọng đối với ngành dữ liệu hơn bất kỳ benchmark bot-detection nào được công bố trong năm nay. Đó là trận chiến đáng để tham gia.

Bởi vì kịch bản dự phòng rất đơn giản. Nếu traffic của bạn không thể tự định danh chính nó, người khác sẽ định danh nó thay bạn.