Hướng dẫn dùng tool

Công Cụ Kiểm Tra & Xác Thực Luật Robots.txt

Cách dùng công cụ kiểm tra robots.txt

Quay lại công cụ

Một URL và một crawler đi vào; câu trả lời là con bot ấy có được tải địa chỉ ấy không, và dòng nào của robots.txt quyết định điều đó.

  1. 01

    Nhập URL cần kiểm

    Dán chính trang cần hỏi, không phải file robots.txt — công cụ tự đọc origin từ đó rồi tải /robots.txt về. Ô Chuẩn hoá URL vẫn quan trọng: để mức Chỉ domain là bạn đang hỏi về trang chủ, vì đường dẫn mới là nửa địa chỉ được đem đi khớp.

  2. 02

    Chọn crawler cần kiểm

    Luật là của từng crawler, nên cùng một URL có thể được phép với bot này mà bị chặn với bot kia. Nút kiểm khoá tới khi đã chọn bot — không có giá trị mặc định nào hợp lý, và mặc định sai là trả lời cho một câu bạn không hỏi. Mục Mọi crawler khác chính là nhóm *.

  3. 03

    Chạy kiểm tra và đọc dòng quyết định

    Một lượt là một request: server chỉ tải file, còn phép khớp chạy ngay trong trình duyệt bạn. Cả file hiện ra có đánh số dòng, dòng luật thắng đổi nền và số của nó thay bằng icon. Copy và Download ở hàng ngay trên đưa cho bạn CHÍNH file ấy, không phải một bản tóm tắt — file tải về là một robots.txt thật, thả thẳng vào site là dùng được.

  4. 04

    Đọc kết luận bên dưới file

    Dưới file là: đã đọc robots.txt nào và nó trả về gì, đường dẫn đã đem đi khớp, kết luận kèm dòng luật thắng nhắc lại ngay cạnh, và mọi dòng Sitemap: file khai. Nhắc lại dòng luật là cố ý — file có thể dài tới mức dòng được tô đã trôi khỏi tầm nhìn lúc bạn đọc tới kết luận.

Cách đọc kết luận về luật thu thập

Kết luận chỉ là một chữ; mọi thứ còn lại trên trang có mặt để chỉ ra chữ ấy đến từ đâu.

Các giá trị kết luận

Được phép
Không luật nào khớp đường dẫn này, hoặc luật thắng là một dòng Allow. Host không có robots.txt cũng cho ra đúng chữ này: không có file nghĩa là không cấm gì.
Bị chặn
Luật thắng là một Disallow, được nêu tên ngay cạnh phán quyết. Bị chặn thu thập không phải là bị gỡ khỏi chỉ mục: URL bị chặn vẫn có thể được liệt kê, nên noindex phải nằm trong thẻ meta, không phải ở đây.
Không xác định
Không đọc được file, hoặc nó trả 200 kèm một trang web thay vì luật. Google coi robots.txt không đọc được là chặn toàn bộ trong khoảng mười hai giờ, nên trả lời Được phép ở đây sẽ là câu trả lời sai duy nhất.
Đường dẫn
Phần địa chỉ thật sự được đem đi khớp: đường dẫn cộng query, bỏ fragment. Phần này phân biệt hoa thường, khác với tên bot.
Sitemap đã khai
Mọi dòng Sitemap: trong file, đã khử trùng. Những dòng ấy là toàn cục — chúng thuộc về file chứ không thuộc nhóm crawler nào, nên chọn bot nào cũng vẫn áp dụng.

Thứ tự ưu tiên của luật

Mẫu dài nhất thắng
Hai dòng cùng khớp thì mẫu dài hơn quyết định, đếm cả * và $ như ký tự thường. Vì thế Disallow: /shop thua Allow: /shop/public trên /shop/public, và thắng trên /shop.
Bằng độ dài thì Allow thắng
Cùng độ dài, Allow thắng Disallow — cách đọc ít hạn chế nhất, và cũng là cách bản parser chuẩn làm.
Chỉ nhóm của bot bạn chọn
Mọi nhóm gọi đúng tên bot đều được gộp lại, kể cả khi file chia chúng ra hai chỗ. Nhóm * chỉ dùng khi KHÔNG nhóm nào gọi tên nó: file đã có mục Googlebot thì mục * của file ấy không áp thêm cho Googlebot.
* và $
* thay cho một dãy ký tự bất kỳ. $ neo mẫu vào cuối URL, nhưng chỉ khi nó đứng ở cuối mẫu — nằm chỗ khác thì nó chỉ là một ký tự thường.
Disallow bỏ trống
Không cấm gì cả. Đó là cách một file nói "nhóm này không bị hạn chế", và nó khác hẳn Disallow: /.

Khi không đọc được file

Không có robots.txt (404)
Không cấm gì, nên kết luận là Được phép và không có file để bày ra. Chuỗi chuyển hướng quá năm chặng cũng tính là không có file — đó là chỗ crawler chuẩn bỏ cuộc.
Không đọc được
Một mã 5xx, một 429, hết giờ, hay kết nối bị từ chối. Kết luận là Không xác định và không bày file nào — thân một trang lỗi không phải luật của bạn.
200 kèm HTML
Soft 404: server trả lời như thể file tồn tại nhưng gửi về một trang. Crawler đọc ra rác, nên kết luận là Không xác định — và ca này đáng sửa, vì mở bằng trình duyệt thì không thấy gì bất thường.
Chỉ 500 KiB đầu
File bị cắt ở mức ấy trước khi khớp, đúng trần bản parser chuẩn đọc. Luật nằm sau chỗ cắt cũng không tồn tại với bất kỳ crawler nào.
File có nhưng không đặt luật nào
File rỗng, hoặc chỉ có comment và các dòng Sitemap:. Hợp lệ, và không cấm gì.