Hướng dẫn dùng tool

Công Cụ Kiểm Tra Meta Robots & X-Robots-Tag Hàng Loạt

Dữ liệu kiểmMeta Robots

Cách dùng công cụ kiểm tra thẻ meta robots hàng loạt

Quay lại công cụ

Mỗi URL được tải một lần và cả hai nơi một luật index có thể nằm đều được đọc: thẻ meta robots trong head và header phản hồi X-Robots-Tag.

  1. 01

    Nhập các URL cần kiểm

    Chế độ một URL kiểm một địa chỉ và chạy khi bấm Enter. Chuyển sang Hàng loạt để dán danh sách, mỗi dòng một URL, tối đa 30 mỗi lượt. Những trang đáng dán cùng nhau là những trang phải khác nhau: trang sản phẩm buộc phải được index cạnh trang tìm kiếm không được index, để một lượt cho thấy cả hai câu trả lời cạnh nhau.

  2. 02

    Chọn mức chuẩn hoá URL

    Chuẩn hoá URL viết lại từng địa chỉ trước khi tải. URL đầy đủ giữ đường dẫn và query nhưng bỏ tham số theo dõi cùng fragment; Bỏ query bỏ query string; Chỉ domain chỉ giữ tên miền. Luật index đặt theo template, và query string là thứ phân biệt trang tìm kiếm với trang danh mục của nó; bỏ nó đi là bạn kiểm trang danh mục thay vì trang tìm kiếm.

  3. 03

    Đọc cột Robots

    Cột hiện nguyên văn các chuỗi chỉ thị đúng như trang khai, mỗi dòng một chuỗi, và không phán xét gì. Chỉ thị nhắm một crawler duy nhất được hiện kèm tên ấy phía sau, ví dụ [googlebot], vì một từ nhắm riêng một crawler có ý nghĩa nhỏ hơn. Ô trống nghĩa là không khai gì, và đó không phải lỗi: trang như thế được index và được theo link.

  4. 04

    Mở một hàng và xuất kết quả

    Xem tổng kết các chỉ thị và đánh dấu nguồn của từng chỉ thị: [html] cho thẻ meta, [header] cho header. Thẻ meta nằm trong template, header nằm ở cấu hình server hoặc CDN. Dấu thứ hai đánh vào chỉ thị nhắm một crawler; kết luận chỉ tính nó khi ô User agent đang chọn đúng crawler ấy. Copy bảng sao chép các hàng ngăn bằng tab; Xuất CSV ghi chúng ra file.

Cách đọc báo cáo noindex và nofollow

Một hàng đọc từ trái sang phải: địa chỉ đã kiểm, nơi nó đáp xuống, và luật trang ấy đặt cho crawler.

Các cột của bảng kết quả

URL
Địa chỉ đúng như lúc đem đi kiểm — sau chuẩn hoá, không phải lúc nào cũng giống thứ bạn gõ vào.
URL đích
Nơi request dừng lại và mã trạng thái ở đó. Chuyển hướng được đi theo trước, và luật đọc từ trang cuối ấy.
Robots
Mọi chuỗi chỉ thị mà trang cuối khai, mỗi chuỗi một dòng, giữ nguyên văn, và kèm tên crawler ngay sau khi chỉ thị ấy chỉ nói với một con bot. — nghĩa là không khai chỉ thị nào.
Kết quả
Hàng đã xong, đang chạy, hay dừng vì lỗi. Nó không nói gì về bản thân luật.
Thao tác
Xem mở panel Chi tiết của hàng ấy; Thử lại hiện thay vào đó khi request không tới được nơi nào.

Kết luận của panel Chi tiết

Cho phép index và đi theo liên kết.
Có khai gì đó, và không phần nào trong đó chặn thứ gì — một chữ index, một chữ follow, hoặc những chỉ thị chỉ nắn lại đoạn mô tả. Kết cục giống hệt việc không khai gì, chỉ khác là nó được nói ra thành lời.
Không khai chỉ thị robots — mặc định là index, follow.
Không khai gì, nên mặc định được áp dụng: được index và được theo link. Đúng với phần lớn trang.
Có nofollow — liên kết trên trang này không được đi theo.
Trang được index nhưng liên kết của nó không truyền gì đi. Hiếm khi là thứ một trang công khai muốn, và rất dễ thừa hưởng từ một template vốn dựng cho việc khác.
Có noindex — trang này sẽ không được index.
Trang bị giữ ngoài chỉ mục. Đúng với trang tìm kiếm hay trang cảm ơn, và là sai lầm đắt nhất trên trang bạn định xếp hạng. none cũng tính ở đây: nó là cách viết tắt của noindex cộng nofollow.
Hai nguồn khai khác nhau — Google lấy chỉ thị nghiêm hơn.
Một nguồn chặn index còn nguồn kia thì không. Google lấy nguồn nghiêm hơn, nên trang bị loại; chỉ đọc nguồn cho phép sẽ cho bạn kết luận ngược lại.
Không chỉ thị nào áp cho mọi crawler — mỗi chỉ thị ở trên nhắm riêng một con bot, và loại đó không được kiểm.
Mọi thứ trang khai đều nhắm tới một crawler có tên, nên không có luật chung nào để phán. Hãy tự đọc các chỉ thị đã liệt kê: trang mở cho tất cả trừ Googlebot vẫn là trang Google sẽ không lập chỉ mục.
Chỉ thị nhắm riêng một crawler được kể ra nhưng không kiểm — kết luận ở trên chỉ tính những chỉ thị áp cho mọi crawler.
Trang khai cả hai loại. Kết luận chỉ đúng với những luật chung, còn các chỉ thị có tên nằm ngay trên nó mà không được chấm — đáng đọc khi con bot được gọi tên đúng là con bot bạn quan tâm.
Không chỉ thị nào ở đây áp cho Googlebot Smartphone — mỗi dòng trên đều nhắm một crawler khác.
Bạn chạy bằng một crawler có tên, còn mọi dòng trang khai đều nhắm crawler khác. Không có gì ở đây hạn chế crawler bạn chọn; các dòng được liệt kê là dành cho bot khác.
Kết luận trên nói về Googlebot Smartphone: chỉ thị nhắm riêng nó được tính, chỉ thị nhắm crawler khác thì không.
Hiện khi bạn chạy bằng một crawler có tên và trang có gọi tên crawler nào đó. Dòng nhắm đúng crawler bạn chọn được gộp với luật chung vào kết luận; dòng nhắm crawler khác chỉ được liệt kê.
Các chỉ thị tính cho Googlebot Smartphone khai khác nhau — kết luận trên lấy chỉ thị nghiêm hơn.
Bạn chạy bằng một crawler có tên và các dòng áp cho nó khai khác nhau: một dòng chặn index, dòng kia thì không. Kết luận lấy dòng nghiêm hơn. Google ghi rõ họ cũng làm vậy; crawler khác theo luật riêng của hãng.

Một chỉ thị có thể đến từ đâu

[html]
Một thẻ <meta name="robots"> trong head của trang. Sửa nó ở đúng cái template dựng ra head ấy.
[header]
Một header phản hồi X-Robots-Tag. Cách duy nhất đặt luật cho file không có head, như PDF hay ảnh, và dễ quên vì mã nguồn trang không bao giờ hiện nó. Sửa trong cấu hình máy chủ hoặc CDN.
[googlebot] và các tên crawler khác
Chỉ thị nhắm tới một crawler duy nhất: <meta name="googlebot">, hoặc dòng X-Robots-Tag có tiền tố tên crawler. Nó được liệt kê kèm tên ấy, và chỉ bị phán khi ô User agent đang chọn đúng crawler ấy. Hãy tự đọc những dòng đó: trang chỉ chặn riêng Googlebot sẽ không xếp hạng.