Công Cụ Kiểm Quyền Truy Cập Của Bot AI
Cách dùng công cụ kiểm tra quyền truy cập AI bot
Quay lại công cụMột trang đi vào; mọi AI crawler chúng tôi theo dõi đều được đo trên trang ấy hai lần, bằng hai cách độc lập.
- 01
Nhập trang bạn muốn AI crawler tiếp cận
Mỗi lượt một trang: phép so sánh ở đây là giữa các bot, không phải giữa các URL. Chọn đúng trang bạn quan tâm, vì luật robots.txt được so với đường dẫn của nó. Luật chặn /blog/ sẽ không hiện ra nếu bạn kiểm trang chủ, và luật CDN gắn với đường dẫn cũng vậy.
- 02
Chạy kiểm tra trên cả 22 bot
Không có ô chọn bot, và đó là cố ý. Cột Nội dung đo mỗi bot so với 21 bot còn lại trong cùng lượt chạy, nên chạy một phần sẽ lấy mất thước đo khiến cột ấy có nghĩa. Mỗi bot được tải lần lượt, nên hàng chưa tới lượt có thể chạy lại riêng.
- 03
Đọc hai phán quyết cạnh nhau
robots.txt là điều bạn khai; HTTP Status là điều máy chủ thực sự làm. Hàng mà hai bên khớp nhau là chuyện thường. Hàng đáng chú ý là hàng hai bên trái nhau, và chúng mang icon cảnh báo: file cho phép nhưng máy chủ từ chối, hoặc file chặn mà vẫn phục vụ trọn trang.
Cách đọc báo cáo quyền truy cập của AI crawler
Một hàng đọc từ trái sang phải: bot nào, robots.txt nói gì về nó, và máy chủ thực sự làm gì. Mọi request đều do chúng tôi gửi, mang chuỗi User-Agent của bot ấy; crawler thật của hãng vẫn có thể hành xử khác.
Các cột của bảng kết quả
- URL đích
- Nằm trên bảng, không nằm trong bảng. Đây là địa chỉ chúng tôi đã đo, tải một lần bằng User-Agent định danh của Vutral — nhóm đối chứng để so mọi hàng bot.
- Hãng
- Hãng vận hành crawler. Các hàng gom theo hãng, nên một hãng đọc thành một khối liền.
- Bot
- Token bạn sẽ viết sau User-agent: trong robots.txt. Bot mang nhãn UA chưa xác minh là bot hãng không công bố chuỗi User-Agent nào; bot mang nhãn UA là token thì chỉ có đúng token này, và đó là thứ chúng tôi gửi.
- Mục đích
- Crawler thu thập để làm gì — huấn luyện mô hình, dựng chỉ mục tìm kiếm, tải một trang vừa có người hỏi tới, hay kiểm trang đích của quảng cáo.
- robots.txt
- Tầng một, tính từ chính file của bạn: robots.txt có cho phép token này trên đường dẫn này không? Rê chuột lên phán quyết để thấy luật nào đã khớp. Cột biến mất khi site không có robots.txt, và dòng phía trên bảng nói rõ điều đó.
- HTTP Status
- Tầng hai, đo thật: server trả gì cho một request mang User-Agent của bot ấy. Đây là tầng robots.txt không thể cho bạn biết.
- Nội dung
- Bot ấy nhận được bao nhiêu ký tự văn bản hiển thị. Thước đo là các bot khác trong cùng lượt, nên một con số thấp hẳn so với phần còn lại nghĩa là trang bị cắt, không phải khác biệt ngôn ngữ.
- Kết quả
- Bản thân phép đo có xong không. Đây là một badge chứ không phải nút — nút chạy lại của hàng lỗi nằm ở cột kế bên.
- Thao tác
- Mỗi hàng cần thì có đúng một nút: bot hết giờ, hoặc chưa tới lượt, được một nút chạy lại đo lại riêng hàng ấy. Hàng xong sạch thì cột này trống.
Tra cứu icon cảnh báo
- Cho phép, mà lại 4xx hoặc 5xx
- robots.txt mời bot vào còn thứ gì đó đứng trước server thì đuổi nó ra — thường là một luật bot của CDN hay WAF mà bạn không viết. Đây chính là phát hiện tool sinh ra để tìm.
- Chặn, mà lại 2xx
- Khoảng cách theo chiều ngược: robots.txt nói không, trang vẫn được trả. Không có gì thi hành robots.txt cả, nên crawler nào phớt lờ nó vẫn lấy sạch trang.
- Nội dung ít hơn hẳn
- HTTP Status trông lành mà thân trang chỉ bằng một phần các bot khác nhận. Thường là trang thử thách hoặc bản rút gọn, và một mình cột ấy không bao giờ thấy được điều đó.
- UA chưa xác minh
- Hãng không công bố chuỗi User-Agent nào, nên chuỗi của chúng tôi lấy từ access log và có thể đã cũ. Đọc hàng ấy với mức tin cậy thấp hơn phần còn lại.
- UA là token
- Hãng công bố token dùng trong robots.txt nhưng không công bố chuỗi User-Agent, nên request chúng tôi gửi mang chính token ấy. Lưu lượng thật của crawler đó có thể khác, nên đọc hàng ấy như một dấu hiệu chứ không phải phép đo chính xác.
Tra cứu mã trạng thái
- 200 OK
- Bot lấy được trang. Hãy nhìn cột Nội dung trước khi kết luận là ổn.
- 403 Forbidden
- Bị từ chối. Gần như luôn là một luật chặn bot chứ không phải trang hỏng — cùng URL ấy mở bằng trình duyệt thường vẫn bình thường.
- 404 Not Found
- Không có gì ở địa chỉ ấy đối với người khách này. Nếu bot khác nhận 200 cho cùng URL thì khác biệt ấy là do cố ý.
- 429 Too Many Requests
- Bị giới hạn tần suất. Site của bạn đang bóp lưu lượng chứ không chặn — hãy chạy lại hàng đó thay vì đọc nó thành một chính sách.