← Tất cả bài viết

Web Scraping Tarpits: Ai Thực Sự Bị Sập Bẫy

Các trang web đang triển khai các tarpit để bẫy các AI crawler và cung cấp dữ liệu rác cho chúng. Nhưng những chiếc bẫy này không phân biệt giữa GPTBot và công cụ theo dõi giá của bạn.

Các website đang đặt bẫy bot thu thập dữ liệu AI

Một công cụ có tên Nepenthes đã lan truyền mạnh mẽ vào đầu năm 2025. Nó tạo ra các mê cung vô tận gồm các trang web giả mạo, mỗi trang lại liên kết đến nhiều trang giả mạo khác, được thiết kế để nhốt crawler vào một vòng lặp không thể thoát ra. Nội dung văn bản trên những trang đó là gì? Đó là những đoạn văn bản vô nghĩa được tạo tự động bằng thuật toán, nhằm làm ô nhiễm dữ liệu huấn luyện AI bằng dữ liệu rác.

Nepenthes không phải là trường hợp duy nhất. Các dự án như Locaine và một danh sách ngày càng tăng các "tarpit" mã nguồn mở đã xuất hiện trên GitHub, tất cả đều có chung một thông điệp: nếu các công ty AI không tôn trọng robots.txt, chủ sở hữu website sẽ đáp trả bằng dữ liệu độc hại.

Động lực đằng sau điều này rất dễ hiểu. Một nghiên cứu học thuật trên arXiv phát hiện tỷ lệ chặn AI trên các trang web uy tín đã tăng từ 23% vào tháng 9 năm 2023 lên gần 60% vào tháng 5 năm 2025. Phân tích của BuzzStream cho thấy 79% các trang tin tức hàng đầu hiện chặn bot huấn luyện AI qua robots.txt. Và Cloudflare Radar đã báo cáo rằng 75% lưu lượng web liên quan đến AI vào giữa năm 2025 được tạo ra cho mục đích huấn luyện, không phải cho tìm kiếm hay suy luận (inference).

Nhưng tarpit không kiểm tra danh tính. Chúng không quan tâm lý do bạn crawl dữ liệu. Chúng bẫy bất cứ thứ gì có dấu hiệu tự động hóa.

Ai thực sự đang sập bẫy

Mục tiêu nhắm tới rất rõ ràng: GPTBot, ClaudeBot, các crawler của công ty AI đang thu thập dữ liệu web công khai để huấn luyện mô hình. Vấn đề là tarpit không thể phân biệt giữa crawler của OpenAI và script theo dõi giá của bạn.

Tarpit phát hiện các mẫu request tự động. Nếu scraper của bạn theo dõi các liên kết một cách có hệ thống, truy cập các trang theo các khoảng thời gian đều đặn, hoặc bỏ qua việc thực thi JavaScript (cách mà hầu hết các crawler huấn luyện AI hoạt động), nó sẽ bị coi là mục tiêu. Cái bẫy không quan tâm bạn là một nhóm thương mại điện tử 10 người đang theo dõi giá đối thủ. Nó thấy lưu lượng có hành vi giống bot và bắt đầu trả về các trang giả mạo.

Điều này không chỉ là lý thuyết. Nghiên cứu từ Rutgers và Wharton chỉ ra rằng các trang chặn crawler AI ghi nhận mức giảm 23,1% tổng lưu lượng truy cập và giảm 13,9% lưu lượng người dùng thực. Thái độ chặn quyết liệt không chỉ ngăn bot AI. Nó còn làm tổn hại đến khả năng hiển thị của chính trang web.

Và tarpit còn đi xa hơn: chúng chủ động làm lãng phí tài nguyên tính toán, lưu trữ và băng thông của crawler trong khi cung cấp dữ liệu làm suy giảm chất lượng bất kỳ mô hình hoặc cơ sở dữ liệu nào đang được xây dựng.

Các mức độ leo thang

Robots.txt vốn dĩ luôn là một thỏa thuận mang tính tự nguyện. Nó hoạt động hiệu quả khi mọi người đều tuân thủ luật chơi. Khi các công ty AI lớn bắt đầu phớt lờ nó (hoặc tìm cách diễn giải lắt léo giữa "crawl cho tìm kiếm" và "crawl để huấn luyện"), các chủ sở hữu website đã leo thang biện pháp đối phó.

Mô hình diễn ra như sau:

  1. Chặn bằng Robots.txt: yêu cầu mang tính lịch sự
  2. Lọc User-agent: chặn các chữ ký crawler AI đã biết
  3. Nhận diện hành vi: bắt các crawler lạ dựa trên mẫu request của chúng
  4. Tarpit: các biện pháp đối phó chủ động nhằm làm lãng phí tài nguyên và làm nhiễm độc dữ liệu

Mỗi bước chặn được nhiều mối đe dọa hơn. Mỗi bước cũng vô tình chặn thêm nhiều lưu lượng truy cập hợp lệ. Đến bước thứ tư, bạn đang coi mọi truy cập tự động là thù địch. Vì vậy, một scraper thu thập giá sản phẩm công khai cho dịch vụ so sánh giá cũng sẽ dính bẫy tương tự như GPTBot thu thập dữ liệu trái phép.

Các đội ngũ dữ liệu nên làm gì lúc này

Nếu bạn đang vận hành hệ thống thu thập dữ liệu ở bất kỳ quy mô nào, tarpit sẽ làm thay đổi luật chơi. Một số yếu tố hiện quan trọng hơn trước đây rất nhiều.

Luôn tôn trọng robots.txt. Điều này nghe có vẻ cơ bản, nhưng hiện là yêu cầu bắt buộc tối thiểu. Các trang web dùng robots.txt như bộ lọc bước đầu. Bỏ qua nó, bạn sẽ tự xếp mình vào cùng nhóm với các bot huấn luyện AI, vốn là nguyên nhân châm ngòi cho toàn bộ làn sóng phản ứng bằng tarpit này.

Đừng hành xử giống crawler huấn luyện. Các crawler huấn luyện AI có những chữ ký rất dễ đoán: truy cập mọi liên kết, request trang hàng loạt, bỏ qua JavaScript và duy trì các khoảng thời gian đều đặn. Nếu scraper của bạn cũng làm như vậy, hệ thống nhận diện hành vi sẽ gắn cờ cảnh báo. Hãy thay đổi thời gian gửi request. Chỉ tải những gì bạn cần. Thực thi JavaScript khi trang web yêu cầu. Chúng tôi đã phân tích các nguyên nhân khiến scraper bị chặn trong Tại sao Web Scraper của bạn liên tục bị lỗi.

Xác thực dữ liệu đầu vào. Tarpit trả về dữ liệu rác nhìn rất hợp lý. Nếu không kiểm tra response trong pipeline, bạn có thể đang lưu trữ văn bản do chuỗi Markov tạo ra như là mô tả sản phẩm thực. Hãy xây dựng bước xác thực như một thành phần cốt lõi, không phải việc bổ sung sau cùng.

Đầu tư vào hạ tầng request. Chiến thuật cũ (xoay vòng IP, thử lại khi thất bại) không còn đủ. Các hệ thống bot-detection hiện đại phân tích dấu vân tay TLS, hành vi trình duyệt và mẫu phiên truy cập. Điều hướng proxy thông minh có thể giúp ích, nhưng sự chuyển dịch thực sự là từ nhận diện cấp IP sang nhận diện cấp hành vi. Nếu bạn đang scrape các trang web dùng nhiều JavaScript, thu thập dữ liệu dựa trên trình duyệt ngày càng trở thành phương pháp đáng tin cậy duy nhất.

Khoảng cách tiếp cận đang ngày càng nới rộng

Chúng tôi nhận thấy web đang tiến tới một sự phân chia rõ ràng. Một bên là các trang web kiếm tiền từ dữ liệu thông qua các thỏa thuận truy cập trả phí, quan hệ đối tác API và cấp phép crawling. Bên còn lại là các trang web coi mọi truy cập tự động là mối đe dọa và triển khai các biện pháp đối phó ngày càng quyết liệt.

Đối với các đội ngũ dữ liệu, điều này đồng nghĩa với việc chi phí thu thập sẽ tiếp tục tăng. Không phải vì công nghệ khó xây dựng hơn, mà vì môi trường trở nên thù địch hơn. Những đội ngũ đầu tư vào các phương pháp scraping có trách nhiệm, minh bạch sẽ duy trì được quyền truy cập. Những ai hành xử giống bot huấn luyện AI sẽ bị mắc bẫy, nhiễm độc dữ liệu và bị khóa hoàn toàn.

Tarpit sẽ không biến mất. Vấn đề đối với đội ngũ của bạn không phải là có nên lo lắng về chúng hay không. Vấn đề là liệu hạ tầng của bạn có thể phân biệt được trang thật và bẫy trước khi dữ liệu đó đi vào cơ sở dữ liệu hay không.