Hướng dẫn dùng tool

Công Cụ Kiểm Quyền Truy Cập Của Bot AI

Cách dùng công cụ kiểm tra quyền truy cập AI bot

Quay lại công cụ

Một trang đi vào; mọi AI crawler chúng tôi theo dõi đều được đo trên trang ấy hai lần, bằng hai cách độc lập.

  1. 01

    Nhập trang bạn muốn AI crawler tiếp cận

    Mỗi lượt một trang: phép so sánh ở đây là giữa các bot, không phải giữa các URL. Chọn đúng trang bạn quan tâm, vì luật robots.txt được so với đường dẫn của nó. Luật chặn /blog/ sẽ không hiện ra nếu bạn kiểm trang chủ, và luật CDN gắn với đường dẫn cũng vậy.

  2. 02

    Chạy kiểm tra trên cả 22 bot

    Không có ô chọn bot, và đó là cố ý. Cột Nội dung đo mỗi bot so với 21 bot còn lại trong cùng lượt chạy, nên chạy một phần sẽ lấy mất thước đo khiến cột ấy có nghĩa. Mỗi bot được tải lần lượt, nên hàng chưa tới lượt có thể chạy lại riêng.

  3. 03

    Đọc hai phán quyết cạnh nhau

    robots.txt là điều bạn khai; HTTP Status là điều máy chủ thực sự làm. Hàng mà hai bên khớp nhau là chuyện thường. Hàng đáng chú ý là hàng hai bên trái nhau, và chúng mang icon cảnh báo: file cho phép nhưng máy chủ từ chối, hoặc file chặn mà vẫn phục vụ trọn trang.

Cách đọc báo cáo quyền truy cập của AI crawler

Một hàng đọc từ trái sang phải: bot nào, robots.txt nói gì về nó, và máy chủ thực sự làm gì. Mọi request đều do chúng tôi gửi, mang chuỗi User-Agent của bot ấy; crawler thật của hãng vẫn có thể hành xử khác.

Các cột của bảng kết quả

URL đích
Nằm trên bảng, không nằm trong bảng. Đây là địa chỉ chúng tôi đã đo, tải một lần bằng User-Agent định danh của Vutral — nhóm đối chứng để so mọi hàng bot.
Hãng
Hãng vận hành crawler. Các hàng gom theo hãng, nên một hãng đọc thành một khối liền.
Bot
Token bạn sẽ viết sau User-agent: trong robots.txt. Bot mang nhãn UA chưa xác minh là bot hãng không công bố chuỗi User-Agent nào; bot mang nhãn UA là token thì chỉ có đúng token này, và đó là thứ chúng tôi gửi.
Mục đích
Crawler thu thập để làm gì — huấn luyện mô hình, dựng chỉ mục tìm kiếm, tải một trang vừa có người hỏi tới, hay kiểm trang đích của quảng cáo.
robots.txt
Tầng một, tính từ chính file của bạn: robots.txt có cho phép token này trên đường dẫn này không? Rê chuột lên phán quyết để thấy luật nào đã khớp. Cột biến mất khi site không có robots.txt, và dòng phía trên bảng nói rõ điều đó.
HTTP Status
Tầng hai, đo thật: server trả gì cho một request mang User-Agent của bot ấy. Đây là tầng robots.txt không thể cho bạn biết.
Nội dung
Bot ấy nhận được bao nhiêu ký tự văn bản hiển thị. Thước đo là các bot khác trong cùng lượt, nên một con số thấp hẳn so với phần còn lại nghĩa là trang bị cắt, không phải khác biệt ngôn ngữ.
Kết quả
Bản thân phép đo có xong không. Đây là một badge chứ không phải nút — nút chạy lại của hàng lỗi nằm ở cột kế bên.
Thao tác
Mỗi hàng cần thì có đúng một nút: bot hết giờ, hoặc chưa tới lượt, được một nút chạy lại đo lại riêng hàng ấy. Hàng xong sạch thì cột này trống.

Tra cứu icon cảnh báo

Cho phép, mà lại 4xx hoặc 5xx
robots.txt mời bot vào còn thứ gì đó đứng trước server thì đuổi nó ra — thường là một luật bot của CDN hay WAF mà bạn không viết. Đây chính là phát hiện tool sinh ra để tìm.
Chặn, mà lại 2xx
Khoảng cách theo chiều ngược: robots.txt nói không, trang vẫn được trả. Không có gì thi hành robots.txt cả, nên crawler nào phớt lờ nó vẫn lấy sạch trang.
Nội dung ít hơn hẳn
HTTP Status trông lành mà thân trang chỉ bằng một phần các bot khác nhận. Thường là trang thử thách hoặc bản rút gọn, và một mình cột ấy không bao giờ thấy được điều đó.
UA chưa xác minh
Hãng không công bố chuỗi User-Agent nào, nên chuỗi của chúng tôi lấy từ access log và có thể đã cũ. Đọc hàng ấy với mức tin cậy thấp hơn phần còn lại.
UA là token
Hãng công bố token dùng trong robots.txt nhưng không công bố chuỗi User-Agent, nên request chúng tôi gửi mang chính token ấy. Lưu lượng thật của crawler đó có thể khác, nên đọc hàng ấy như một dấu hiệu chứ không phải phép đo chính xác.

Tra cứu mã trạng thái

200 OK
Bot lấy được trang. Hãy nhìn cột Nội dung trước khi kết luận là ổn.
403 Forbidden
Bị từ chối. Gần như luôn là một luật chặn bot chứ không phải trang hỏng — cùng URL ấy mở bằng trình duyệt thường vẫn bình thường.
404 Not Found
Không có gì ở địa chỉ ấy đối với người khách này. Nếu bot khác nhận 200 cho cùng URL thì khác biệt ấy là do cố ý.
429 Too Many Requests
Bị giới hạn tần suất. Site của bạn đang bóp lưu lượng chứ không chặn — hãy chạy lại hàng đó thay vì đọc nó thành một chính sách.