Vào tháng 1, 16 triệu request đã chứng minh việc chặn IP không còn hiệu quả
Một cuộc tấn công scalping đã nhắm vào một nền tảng thương mại điện tử lớn vào tháng 1 năm 2026. Mười sáu triệu request phân tán qua 3.9 triệu địa chỉ IP độc nhất. Việc áp dụng rate limit cho từng IP hoàn toàn vô dụng. Cuộc tấn công không thành công nhờ mã nguồn thông minh. Nó thành công vì khối lượng IP khổng lồ đã khiến các phương pháp phát hiện truyền thống trở nên vô nghĩa (SecurityBoulevard, March 2026).
Sự cố đó chứng minh điều mà ngành công nghiệp anti-bot đã nói từ lâu: chỉ dựa vào độ uy tín của IP không thể phân biệt người và bot. Và nếu các hệ thống phòng thủ đã phát triển, scraper cũng cần phải thay đổi.
Ba lớp bảo mật thay thế việc chặn IP
Hệ thống phát hiện bot hiện đại hoạt động trên ba lớp. Chỉ có lớp đầu tiên liên quan đến IP của bạn.
Connection fingerprinting. Trước khi request của bạn đến server, gói tin đầu tiên của kết nối mang một hình dạng đặc trưng để nhận diện thư viện HTTP đang thực hiện request. Thư viện requests của Python, client mặc định của Go, fetch của Node.js, mỗi công cụ tạo ra một fingerprint riêng biệt. Các hệ thống anti-bot kiểm tra điều này trước cả khi đọc bất kỳ header nào. Nếu signature của bạn không khớp với một trình duyệt thực, bạn sẽ bị chặn ngay ở mức kết nối (Reddit r/programming).
Browser fingerprinting. Các trang web hiện nay kiểm tra hơn 300 tín hiệu từ môi trường trình duyệt. Quá trình render Canvas, đầu ra WebGL, context âm thanh, font chữ đã cài đặt, độ phân giải màn hình, múi giờ, thông tin GPU. Chuỗi User-Agent của bạn là tín hiệu kém quan trọng nhất trong toàn bộ stack. Cloudflare, Akamai và DataDome thu thập những thông tin này một cách thụ động thông qua các JavaScript challenge chạy trước khi tải trang (ScrapingBee, 2026).
Phân tích hành vi. Đây là lớp mới nhất và khó làm giả nhất. Các hệ thống anti-bot hiện theo dõi chuyển động chuột, tốc độ cuộn, mô hình click, nhịp độ gõ phím và thời gian giữa các tương tác. Người thật không di chuyển chuột theo những đường thẳng tắp. Họ dừng lại, rê chuột quá nút bấm, cuộn trang thất thường. Bot không làm những điều này, hoặc làm tất cả một cách quá hoàn hảo (r/webdev, 2026).
Hầu hết các đội scraping đang giải quyết sai vấn đề
Có một sự thật khó chấp nhận: hầu hết các đội scraping vẫn đầu tư chủ yếu vào hạ tầng IP. Các proxy pool lớn hơn, residential IP, rotating gateway. Chúng vẫn có giá trị riêng. Độ uy tín của IP vẫn quan trọng như một tín hiệu trong số nhiều tín hiệu khác.
Nhưng việc mua 10,000 residential IP sẽ không giúp ích gì nếu fingerprint ở mức kết nối của bạn chỉ ra đó là "Python script" hoặc headless browser của bạn làm lộ các flag tự động hóa qua navigator.webdriver. Bạn đang tiêu tiền sai chỗ.
Một lập trình viên đã xây dựng 34 scraper cho môi trường production đã viết về vấn đề này (Dev|Journal, March 2026): khoảng cách giữa scraping mức độ cơ bản và những gì hoạt động trên production được định hình bởi các hệ thống anti-bot phân tích connection fingerprint và chuyển động chuột, chứ không phải các DOM selector. Các bài hướng dẫn dạy bạn cách parse HTML. Môi trường production dạy bạn cách sống sót khỏi việc bị phát hiện.
Và tình hình đang trở nên tồi tệ hơn. Báo cáo State of Web Scraping 2026 của Browserless phát hiện ra rằng các headless browser tiêu chuẩn bị đánh dấu thường xuyên hơn trình duyệt thực vì hệ thống anti-bot đã phân loại các điểm khác biệt cụ thể về fingerprint giữa instance của headless và headed browser. Khoảng cách này không hề thu hẹp.
Nếu scraper của bạn liên tục bị lỗi và bạn chỉ tập trung vào proxy rotation, bạn có thể đang sửa sai vấn đề hoàn toàn.
Yếu tố Cloudflare
Cloudflare đáng được nhắc đến vì họ đứng ở cả hai phía của sự chuyển dịch này.
Sản phẩm Bot Management của họ chạy phân tích hành vi trên mọi request, chấm điểm người truy cập trên thang 1 đến 99 dựa trên hàng chục tín hiệu. Turnstile (giải pháp thay thế CAPTCHA ẩn của họ) điều chỉnh động độ khó của challenge dựa trên việc người truy cập trông giống con người đến mức nào (Cloudflare docs).
Cùng lúc đó, Cloudflare ra mắt hạ tầng AI crawling của riêng mình. Cộng đồng đã nhận ra sự trớ trêu này (Reddit r/cybersecurity).
Ý nghĩa thực tế của việc này: các trang web được Cloudflare bảo vệ là khó scrape nhất trong năm 2026 và khoảng 20% tổng số trang web nằm sau mạng lưới của họ. Nếu chiến lược scraping của bạn không tính toán đến việc phát hiện hành vi, bạn đã đánh mất một phần năm mạng internet có thể tiếp cận được.
Những phương pháp thực sự hiệu quả trong năm 2026
Những scraper thành công đều có chung ba đặc điểm.
Thứ nhất, chúng khớp với signature ở mức wire của một trình duyệt mới nhất. Hình dạng thực tế ở mức byte của kết nối phải khớp với những gì một phiên bản Chrome hoặc Firefox hiện tại tạo ra. Không có biện pháp giả mạo header nào có thể sửa chữa một connection fingerprint không khớp.
Thứ hai, chúng chạy các môi trường trình duyệt thực (hoặc giống thực một cách thuyết phục). Không phải các instance headless với cài đặt mặc định. Đó phải là các browser instance thực sự với fingerprint nhất quán khớp với User-Agent mà chúng khai báo.
Thứ ba, đối với các trang web được bảo vệ, chúng thêm các nhiễu hành vi giống con người. Việc làm trễ ngẫu nhiên là chưa đủ. Thời gian giữa các hành động cần tuân theo các phân phối thực tế và đường di chuyển của chuột cần có các đường cong cũng như sự ngập ngừng trông tự nhiên.
Vì vậy, kiến trúc đã thay đổi. Vấn đề không nằm ở việc có nhiều IP hơn. Vấn đề là làm cho mỗi request không thể phân biệt được với một người dùng thực đang sử dụng một trình duyệt thực.
Cuộc chạy đua vũ trang trong việc phát hiện đang tăng tốc
Các nhà cung cấp giải pháp anti-bot đã bắt đầu chia sẻ thông tin tình báo về mối đe dọa trên toàn bộ tập khách hàng của họ theo thời gian thực. Khi một trang web đánh dấu một mô hình bot mới, mọi trang web khác trong mạng lưới sẽ cập nhật chỉ trong vài phút (SecurityBoulevard, March 2026). Đó là một sự thay đổi cơ bản so với mô hình cũ khi hệ thống phòng thủ của mỗi trang web hoạt động độc lập.
Chúng tôi cho rằng điều này có nghĩa là chi phí tự xây dựng hạ tầng scraping sẽ tiếp tục tăng. Mỗi tín hiệu phát hiện mới đều đòi hỏi thời gian kỹ thuật để đối phó và chu kỳ này đang ngày càng nhanh hơn. Các đội ngũ xử lý việc phát hiện ở mức hạ tầng (smart proxy routing, browser fingerprinting, connection-level matching) sẽ vượt trội hơn so với những người tiếp tục giải quyết vấn đề bằng cách bơm thêm IP.
Câu hỏi không phải là liệu bạn có cần thêm proxy hay không. Mà là liệu request của bạn có trông giống con người trước cả khi chúng chạm đến target server hay không.