Công Cụ Tìm Sitemap XML & Trích Xuất URL
Cách dùng công cụ dò sitemap XML
Quay lại công cụMột domain đi vào; thứ trở ra là mọi file sitemap site ấy khai, và các URL nằm trong file nào bạn mở.
- 01
Nhập tên miền hoặc địa chỉ sitemap
Tên miền là lối vào thường dùng: chúng tôi đọc robots.txt, rồi các vị trí chuẩn ở gốc host. Dán một địa chỉ kết thúc bằng .xml hoặc .xml.gz thì đúng file ấy thành gốc của cây, hữu ích khi sitemap nằm ở nơi robots.txt không hề nhắc. Đường dẫn của một trang thường bị bỏ qua; chỉ phần host được dùng.
- 02
Đọc cây file
Lượt dò đọc robots.txt rồi tải những file nó khai — cấp trên cùng, và chỉ cấp ấy. File do một sitemap index khai được liệt kê thẳng từ thân của index, đủ địa chỉ và Cập nhật, nhưng chưa có gì được tải cho chúng — nút Kiểm ở hàng của chúng sinh ra để làm việc đó. Mười request là đủ trả lời câu hỏi phần lớn người ta mang tới đây.
- 03
Bấm Check để đọc nội dung một file
Kiểm tải đúng file ấy: một cú bấm, một request. URL set mở ra các URL trang cùng ngày Last modified của chúng. Index thêm các file con vào cây thành hàng mới. File không đọc được sẽ nói vì sao, và nút đổi thành Thử lại. Kiểm tất cả chạy cùng phép kiểm xuống mọi hàng còn chờ và dừng ngay khi rate limit trả lời.
- 04
Xuất danh sách
Copy bảng và Xuất CSV lấy bảng đúng như đang có: mọi hàng file, cộng các URL trang của file nào bạn đã mở. Năm cột mang cây vào bảng tính: Tầng nói hàng là sitemap hay URL trang; rồi địa chỉ; rồi Sitemap cha, file đã khai nó; rồi Cập nhật; rồi Kết quả, chính file ấy trả lời ra sao — để trống ở hàng trang, vì tool không bao giờ gọi tới URL trang.
Cách đọc báo cáo cây sitemap
Mỗi hàng là một file sitemap, hoặc một URL trang bên trong một file. Hàng im lặng khi không có gì sai, nên bất cứ chữ nào viết cạnh địa chỉ đều đáng đọc. Các trần đều được báo trong bảng, không bao giờ áp dụng âm thầm: một trăm file mỗi lượt quét, ba trăm hàng, 5.000 URL hiện mỗi file, 10 MB mỗi file.
Ghi chú trạng thái của hàng
- Không ghi chú gì, cạnh nút Kiểm
- Chưa tải. Một index đã khai file này, nhưng lượt quét cố ý dừng ở cấp cao nhất: tải mọi file con của mọi index tốn mỗi file một request và trả lời câu hỏi có khi bạn chưa hề hỏi.
- Không ghi chú gì, cạnh nút Xem
- File đã đọc được và không có gì bất thường. Bấm Xem để biết bên trong có gì: các URL trang nếu là urlset, hoặc những hàng con mới nếu hoá ra nó lại là một index.
- 404, 503, Timeout
- Không đọc được file. Một file được index khai mà site không phục vụ là một phát hiện thật — máy tìm kiếm cũng nhận đúng câu trả lời bạn vừa nhận. Nút đổi thành Thử lại để hỏi lại.
- Không phải sitemap (html)
- Server trả 200 nhưng gửi về một trang web. Thường là soft 404, đôi khi là trang chặn. Kiểu nào cũng đáng sửa — nhìn từ trình duyệt thì nó trông vẫn ổn.
- Vượt 10 MB — không đọc
- Quá trần dung lượng, đo sau khi giải nén. Chúng tôi không phân tích thứ chỉ đọc được một nửa: một file XML bị cắt là một file XML hỏng, và một danh sách URL thiếu mà trông như đủ thì tệ hơn là không có.
Các cột của cây
- Index Lv1, Sitemap Lv2, URL
- Cột Tầng chứa cả cái cây: phần thụt, mũi tên ↳ cho file được một hàng phía trên khai, và tên cấp. Index liệt kê các sitemap khác; Sitemap là file chưa đọc; URL là trang nằm trong file phía trên.
- Có ngày ở cột Cập nhật
- Giá trị lastmod mà index cha khai cho file này. Đọc nó không tốn gì và thường là lý do bạn tới đây: nó nói nhánh nào của site vừa đổi. Đó là lời khai của chính site, không phải phép đo.
- Dấu gạch ở cột Cập nhật
- Không có gì khai ngày cho file này. File cấp trên cùng thường nằm ở đây — không có gì phía trên khai điều gì về chúng. Nó không nói lên file cũ hay mới.
- Hàng không có nút
- Một index đã có con nằm sẵn trong cây. Không còn gì để tải cho nó nữa; hãy đọc các con của nó.